先给结论:小样本有效、批量无效,通常不是操作本身错了,而是批量后出现了样本阶段没有的分组差异或执行漂移。复现的关键不是把有效样本再跑一遍,而是把批量任务拆回“同质小组”,逐组验证,直到找出失效从哪一组、哪一步开始。
假设你给 20 个页面改了标题和首段,其中 14 个点击率上升;推到 800 个页面后整体没变化,甚至下滑。此时至少有两种解释:
两种解释对应的修复方向完全不同:前者要重新定义适用页面,后者要修执行流程。所以下一步不是加大批量,而是找证据区分它们。
把批量页面按操作前的状态分层,而不是按操作后的表现分层。可用的分层维度包括:
如果效果只集中在“有展示且意图偏差大”这一层,说明是样本选择问题,批量无效是因为把不适用页面也算了进去。如果同一层里手工改的有效、模板改的无效,说明是执行漂移,问题出在批量写入环节。
这里要强调一个动作:从批量结果中单独抽出“与原始小样本同层”的页面,单独看这一子集的表现。如果这个子集仍然有效,整体无效只是被大量不适用页面稀释,复现路径就是收窄适用范围;如果这个子集也失效,才需要继续查执行。
确认是执行问题后,按下面顺序排查,每一步都能改变下一步动作:
如果排查发现字段被覆盖,先恢复字段再重新小范围验证;如果发现是模板拼接导致意图错位,先改模板规则,再对同层页面重跑。不要在原因未定位时继续扩大批量。
假设某站有 800 个商品页,先手工优化 20 个,两周后其中 12 个点击率上升。随后用模板批量改 800 个,四周后整体点击率无变化。此时把 800 个页面按“操作前 28 天是否有展示”分成两组:有展示组 180 个,无展示组 620 个。若只有有展示组出现与手工样本相近的变化,说明批量无效主要是被无展示组稀释,复现条件是“只对已有展示的页面执行”。若两组都无变化,则回到执行漂移排查,重点看模板标题是否把长尾意图统一成了大词。
这个例子里,两周和四周只是说明比较窗口,不代表固定见效时间;实际比较还要考虑季节、搜索需求波动和数据采集口径差异,不能把一次前后对比直接当成因果。
最终可操作的复现方式是:不再按“全站批量”推进,而是按同质小组推进。每个小组满足同一意图类型、同一页面结构、同一操作方式。每组执行后,只与本组操作前基线比较,并记录该组适用的条件。这样即使整体批量无效,也能定位到哪一类页面、哪一种执行方式仍然成立。
如果某个小组在小样本和批量子集中都稳定有效,再逐步扩大该组的页面数量;如果某组始终无效,就把它从操作范围里剔除,而不是继续用同一模板硬套。