结论先说:当页面数量、栏目层级或内容更新频率增长到“每次改动都要逐页打开确认”的程度,手工做全站检索、逐条核对收录状态、人工比对重复标题这三类工作就不再适合继续手工执行。判断标准不是网站有多大,而是同一项检查是否需要重复覆盖几十个以上页面、且结果会随每次发布而变化。反例是:如果站点只有少量核心页面、更新频率低,手工检查反而更快,引入半自动流程只会增加维护成本。
规模扩大后最先失效的不是“判断”,而是“覆盖”。判断某个栏目该不该保留,人工看几页就能下结论;但要确认这个栏目下所有页面是否都用了同一套标题规则,人工就会漏。可以从三个特征识别:
符合其中两条以上,就应把这项工作从“逐页手工”转为“先批量取数、再人工判断”。注意这里说的是取数和初筛自动化,不是让工具替你做内容决策。
百度高级搜索的价值在于把“限定条件”写进检索,而不是靠人工翻页记忆。规模扩大后,它适合承担两类原本手工做的事:一是用site:配合关键词,快速看某类页面在百度中的呈现是否成片异常;二是用intitle:、inurl:限定标题或路径,抽查某一批页面是否出现标题重复、路径命名混乱。
但它不能替代抓取与索引的完整核查。检索结果里看不到某页,可能是尚未被抓取、被抓取但未索引、被索引但当前查询词不匹配,也可能是结果被折叠。这几种原因对应完全不同的下一步动作,不能因为一次检索为空就断定页面有问题。更稳妥的做法是:先用高级搜索圈出可疑范围,再回到站点自身的日志或站长平台数据确认是抓取、索引还是匹配环节的问题。
假设一个站点从几十页扩到几百页,编辑每次发布后都手工打开新页面,确认标题、描述、正文首段是否完整。规模小的时候这可行;页面变多后,同样的动作要重复几百次,且每次发布都要重来。
可改为:发布后先用site:加栏目路径,抽查该批页面是否被百度收录到可检索状态;再用intitle:加同一批页面的标题模板,看是否出现大量重复标题。这样做的结果是,人工只处理被筛出的异常页,而不是全部页面。下一步动作也随之改变:如果异常集中在标题重复,就回到模板层修改规则;如果异常集中在未被索引,就先查抓取,而不是继续改标题。
反例同样重要。如果站点页面数量有限、栏目结构稳定、每次发布只涉及少量页面,手工检查的准确性和速度都可能优于搭建批量流程。此时强行引入检索脚本或半自动清单,反而要额外维护规则、处理误报,得不偿失。
另一个需要保留手工的场景是:检查目标本身依赖语义判断,比如某段内容是否真正回答了用户问题、某组页面是否在互相抢同一批检索词。这类判断可以借助高级搜索缩小范围,但最终结论仍应由人做。
具体动作是:列出当前所有需要重复执行的检查项,逐项标注它属于“取数”还是“决策”。取数类(如某批页面是否出现在检索结果、标题是否重复)转为批量初筛;决策类(如某栏目是否保留、某批内容是否合并)保留人工。这样做的结果是,规模扩大后增加的是初筛范围,而不是人工重复次数;当某类异常反复出现在初筛结果里,就说明该问题的根源在模板或结构层,下一步应去改规则,而不是继续逐页修补。