试验性工作的“完成”不能等同于“拿到排名”,而应定义为:在事先约定的观察窗口内,按约定方式采集到可核对的证据,并据此得出继续、调整还是停止的结论。换言之,完成的是判断,不是结果。
同样是“没有承诺结果”,试验的收尾方式取决于你能否事先锁定变量。
两类条件的分界点在于:你能否在开始前写下“如果出现X,就说明有效;如果出现Y,就说明无效”。写不出来,就属于第二类,不要用第一类的验收口径去要求交付方。
试验性工作最容易扯皮的地方,是双方对“做了”和“有用”混着谈。可行的做法是把完成定义拆成三层,逐层验收:
动作层和采集层可以做到“完成或未完成”,结论层只能做到“已给出”。把结论层也当成硬性交付,就会逼出过度承诺。
试验中最常见的反常现象是:改动上线后,某些词的位置不升反降,或者抓取量、索引量突然归零。这时候不要立刻判定“做坏了”或“做对了”。
抓取量或索引量归零,至少有几种合理解释:站点地图提交出错、robots 规则被误改、服务器在采集时段返回异常、后台统计口径调整、或者只是采集周期与更新周期错位。这些解释与“优化有效/无效”无关,却会直接改变你看到的数字。
可区分的证据包括:
如果多个独立来源同时指向同一变化,才值得把它当作信号;如果只有单一后台的单一指标异动,先按采集问题排查。
假设某站点对 20 个词做标题与内链调整,约定观察 8 周。第 4 周时,其中 6 个词的位置明显上升,同时全站抓取量下降约三成。
此时合理的处理不是宣布“试验成功”,而是:先核对抓取量下降是否由站点地图或服务器异常引起;若排除采集问题,则把结论写成“6 个词的变化方向与预期一致,但全站抓取异常未排除,本轮不足以支持全面推广该改法”。完成标志是这份带保留结论的记录已交付,而不是那 6 个词是否继续上升。
完成不等于必须做满整个窗口。出现以下情形,可以提前收尾并记为“已完成,结论为停止”:
提前停止同样需要留下记录:停在哪一步、依据是什么、哪些数据仍然有效。这样下一轮试验才能从已有证据接着走,而不是从零重来。
把完成定义在证据和判断上,试验性工作就有了可验收的边界;把它定义在排名和流量上,双方都会被迫在无法控制的事情上互相消耗。