看视频时跟着做一遍能出结果,换成十道实操题让学习者独立完成,却出现有人做对、有人做错、有人做出了看似正确但无法复核的页面。问题通常不在题目难度,而在于输出没有被定义成可判定的形式。可判定的输出,指的是不看过程、只看提交物就能判断对错或合格与否的产物,例如一份字段齐全的判断表、一段可对照规则逐条检查的改动说明,而不是“优化一下这个页面”这类只能靠感觉验收的要求。
把视频里的操作转成实操题时,常见的写法是给一个页面或一个词,要求“做一次基础优化”。这种题目在样本少时看起来有效,因为出题人心里有一套默认标准,批改时按自己的理解打分。规模一上来,例外就出现了:有人只改了标题,有人改了标题又重写了描述,有人连内链一起动了。三种提交都算“做了优化”,却无法比较,也无法指出错在哪。
一个合理的解释是题目缺少判定对象。学习者的注意力被引导到“做什么动作”,而不是“产出什么可被检查的东西”。另一个解释是判定标准停留在出题人脑中,没有转成学习者可以自查的形式,于是同一份提交在不同批改人手里得到不同结论。这两种解释指向的修改方向不同,需要区分。
假设有一道题:给出一篇围绕某个主题的旧文,要求完成一次标题与结构层面的调整。现在有一份假设提交,只改了标题,正文结构未动。如果问题出在判定对象缺失,那么把题目改成“提交一份包含原标题、新标题、改动理由、未改动部分说明的对照表”,这份提交立刻能被判定为“部分完成”,因为对照表里“未改动部分”一栏是空的或写着“无”。如果问题出在标准未外化,那么即使加了对照表,只要没有说明“标题改动需对应正文中至少一个小节的内容支撑”,批改人仍会凭感觉判断这份提交够不够。
能区分两种解释的证据是:把同一份旧提交分别放进“只有对照表”和“对照表加逐条判定规则”两个版本里,看批改结果是否收敛。若前者分歧大、后者分歧小,说明主要缺口在判定规则;若两者分歧都大,说明判定对象本身还没定清楚。这个对比不需要真实项目,用几份历史提交重批一次就能看出方向。
可判定的输出通常包含三层,缺一层就会出现模糊地带。第一层是产物本身,必须是一个具体文件或一段具体文本,例如一份对照表、一段改动前后的代码片段、一张关键词到页面位置的映射清单。第二层是每项产物的判定依据,写成可以回答“是或否”的句子,例如“新标题是否包含该页面的核心主题词”“改动理由是否指向正文中一个具体小节”。第三层是例外说明,允许学习者标注“此处不适用”并给出原因,避免为了凑格式而编造内容。
一个实际动作是:把原来“优化这个页面”的题目,改写成“提交一张表,列出你改动的每一处、改动前内容、改动后内容、对应正文位置、判定依据编号”。做完这一步,批改从通读全文变成逐行核对,学习者也能在提交前自己走一遍同样的核对。结果是下一步可以按“哪一层出错最多”来调整教学:产物缺失就补示范,判定依据对不上就补规则讲解,例外说明乱写就补边界案例。
并非所有视频里的知识都能转成逐条勾选的题。涉及判断取舍的内容,例如“这个页面该不该合并到另一个页面”,本身就依赖对站点整体结构的了解,单独一个页面无法判定。涉及长期效果的内容,例如“这次改动是否带来流量变化”,在单次实操的时间尺度内无法验证,硬设成判定题只会逼学习者编造结论。涉及平台规则解释的内容,规则本身可能调整,把某一时点的解释固化成判定标准,过一段时间就会误导人。
遇到这类内容,可行的做法是降低判定强度:把“判断对错”改成“写出你的判断和至少两条支持依据”,判定标准相应改为“依据是否指向页面内可观察的事实”。这样输出仍然可检查,只是检查的是推理链条是否完整,而不是结论是否唯一。边界写清楚之后,学习者知道哪些题有标准答案,哪些题只要求论证充分,不会把两类题混为一谈。
收集一批提交后,先按判定依据逐条统计哪一条最常不通过。如果集中在“改动理由指向正文位置”这一条,说明学习者还没建立改动与内容之间的对应关系,下一步应补的是结构分析练习,而不是继续加题量。如果集中在“例外说明”这一条,说明边界案例讲得太少,下一步应补的是不适用情形的示范。如果各条通过率都不低但整体质量仍差,则要回头检查产物本身是否定得太粗,例如“一段改动说明”可以细化为“一段不超过若干字的改动说明,且每句对应一处改动”。
判定标准不是一次定死的。每次批改后记录哪条规则产生了分歧,把分歧最大的那条改写成更具体的问句,再用于下一批。这样迭代几轮,实操题才会从“看运气批改”变成“按规则核对”,规模化之后例外的比例也会下降,而不是靠增加批改人力去掩盖题目本身的问题。