可判定的输出,核心不是“写一段答案”,而是让批改者只看结果就能判断对错:给出一个明确输入、一个必须交付的产物、一条可核对的判定线。假设你读到一篇讲“内链锚文本优化”的文章,想把其中三点知识转成三道练习题。下面用这个假设情境,把设置过程走一遍,并说明它为什么在单个样本上成立、放大到多篇文章后会出现例外。
很多实操题失败,是因为产物形态本身模糊。“请优化这篇页面的内链”无法判定,因为优化到什么程度算完成没有边界。可判定的第一步是把产物固定成一种可检查的东西:一张表、一段标注文本、一份修改前后的对照清单。
以锚文本练习为例,可以要求交付一张三列表:来源页、原锚文本、改后锚文本。产物形态一旦固定,判定线才有附着点。判定的不是“改得好不好”,而是“是否满足你事先写下的约束”。
这三条判定线都是可以逐行核对的,不需要批改者去猜出题人的意图。做完这一步,下一步才有意义:如果判定线本身无法核对,后面的规模化只会放大混乱。
判定线要落在能指出位置、能数出数量、能对照原文的层面。凡是需要主观感受的表述,都要换成可指认的证据。
把“锚文本自然”换成“改后锚文本与来源页正文中出现的同义表述一致,且能指出该表述在来源页中的位置”。把“覆盖了重点”换成“三处内链分别指向三个不同目标页,无重复指向”。这样批改者只需要在原文里找到对应位置,就能给出判定,而不是凭印象打分。
一个实际动作:在出题时先自己按判定线做一遍,记录每一行是否都能被判为通过或不通过。如果某一行你自己都无法判定,说明这条判定线需要改写,而不是留给答题者自由发挥。这个动作的结果直接影响下一步——只有当出题者能稳定判定,这套题才适合交给别人使用。
假设你只从一篇文章里出三道内链题,判定线围绕这篇文章的术语体系建立,答题者只要读懂这篇文章就能通过。这是成立的。
但当你想把这套出题方法复制到十篇文章、覆盖十个不同子主题时,例外出现了:不同文章的术语不一致,同一判定线在A文里能核对,在B文里找不到对应表述。此时如果继续照搬同一套判定线,答题者会因为文章本身没写清楚而失分,这不是能力问题,而是题目设计问题。
边界就在这里:可判定的输出依赖输入文本本身具备可核对的表述。如果原文只是泛泛而谈,没有具体页面、具体锚文本、具体约束,那么再精细的判定线也落不了地。遇到这种情况,正确动作是换素材,而不是降低判定标准。
规模化之后,最容易被忽略的是那些既不能判通过、也不能判不通过的情况。与其强行二选一,不如在判定表里保留第三档:不可判定,并注明原因,例如“原文未给出目标页主题词”。
这样做有两个结果。第一,批改者不会被迫编造判定依据;第二,累积的“不可判定”记录会反过来告诉你哪类文章不适合作为出题素材。下一步就可以据此筛选素材,而不是反复修改判定线去迁就一篇本身信息不足的文章。
需要说明的是,某道题大量出现“不可判定”,并不能单独证明这套出题方法有问题,也可能只是这一批素材质量偏低。要区分这两种原因,需要换一批素材再跑一遍,看不可判定的比例是否下降。
顺序反过来会省很多返工。先列出判定表:每一行写清输入、产物、判定线、可指认的证据位置。写完判定表后,再把它翻译成给答题者看的题目描述。题目描述里只保留输入和产物要求,判定线可以不完全公开,但必须已经存在。
一个可执行的自检:拿判定表去核对三道题,如果某道题的产物无法对应到判定表中的任何一行,说明这道题缺少判定依据,应当删掉或重写。这个动作的结果决定了整套题能否被稳定复用——能对应上的题留下,对不上的题不进题库。
把文章知识转成实操题,难点不在题目本身,而在于你是否愿意先把判定线写死、写细,再让题目去适配它。判定线写不出来的地方,就是这篇文章还不适合出题的地方。