当页面从几十个增长到几千个,真正该停掉的手工工作不是“全部自动化”,而是那些每次都要重复判断、但判断规则已经稳定的环节。判断标准有两条:这项工作是否只需要执行同一套规则,以及出错后能否被批量发现。两条都满足,就适合交给模板、规则或脚本;只要还需要逐页权衡内容取舍,就继续保留人工。
规则型执行指输入相同、输出格式固定、结果可被校验的动作。例如给新页面补内链、统一标题长度、检查canonical是否指向自身、把已确认的旧链接批量替换。这类工作手工做一百页还能忍,做到一千页时,漏改和改错的比例会上升,而且很难回溯是哪一批出的问题。
判断型决策指每页都要看内容意图、竞争情况和用户需求的动作。例如决定一个栏目该不该拆分、某类页面该合并还是保留、某篇内容该重写还是删除。这些工作即使规模变大,也不该交给统一规则,因为规则一旦覆盖例外,会把本来正确的页面改坏。
一个可操作的区分方法:把最近一周的手工操作列出来,给每项标注“换个人按同样说明能否做出相同结果”。能,就进入待自动化清单;不能,就保留人工,并写清判断依据供后续复核。
如果站点的详情页、列表页、聚合页已经形成稳定模板,那么模板层面的校验就不该继续靠人一页页点开。常见动作包括:检查标题和描述是否为空或重复、检查正文是否少于某个最低字数、检查分页是否互相指向、检查同一内容是否产生多个可访问地址。
实施时先选一个模板,导出该模板下全部URL,用脚本或站内工具跑一遍规则,把结果分成“确定错误”和“需要人工确认”两类。确定错误直接批量修复,需要确认的再人工看。这个动作的结果会直接决定下一步:如果确定错误集中在少数几个字段,说明模板本身有问题,应先改模板再重跑;如果错误分散且无规律,说明数据来源不统一,应先统一导入流程,而不是继续加校验规则。
例外情况:模板刚改版、字段含义还在调整时不建议立刻批量修复。此时规则本身不稳定,批量操作会把临时状态固化下来,反而增加回滚成本。
当页面之间的差异来自用户意图而非模板字段,手工处理仍然合理。典型场景是同一主题下多篇内容互相竞争,需要决定保留哪一篇、合并哪几篇、其余做重定向还是保留访问。这个判断依赖对内容质量、外链分布和实际访问数据的综合判断,统一脚本无法替代。
可以保留人工,但要把判断过程结构化:先按主题聚类,再给每篇标注“保留、合并、重定向、删除”四种结论之一,并记录理由。这样即使规模扩大,后续复核也有依据,不会出现同一类页面这次保留、下次删除的矛盾。
假设一个站点有三百篇围绕同一产品不同型号的文章,其中八十篇内容高度重合。此时适合先人工圈定重合组,再对每组指定一个主页面,其余批量做重定向。批量执行的是已确定的结论,而不是代替人做结论。这个顺序如果反过来,先批量合并再人工检查,往往会丢掉本可保留的长尾访问。
反过来,以下动作不建议轻易交给规则:决定页面是否值得继续维护、判断某类内容是否偏离站点主线、处理用户投诉指向的具体页面。这些动作一旦批量化,错误会同步放大。
不要一次性把全部手工工作替换掉。先选一个模板或一个栏目做试点,记录三件事:批量处理节省的时间、批量处理引入的新错误数量、以及这些错误被发现的平均耗时。如果新错误数量低于手工操作时的漏改数量,且能在下一次发布前被发现,就可以推广到同类模板;如果新错误需要用户投诉才暴露,说明校验环节还不够,应先补校验再推广。
这个判断不依赖某个固定比例,而依赖错误是否可被流程本身发现。抓取量下降、索引量变化这类现象不能单独证明批量处理正确,也可能是内容调整、外部链接变化或抓取预算重新分配的结果,需要结合改动记录一起看。
最终的分工是:规则负责重复执行和异常发现,人负责规则之外的内容取舍和例外裁决。规模越大,这条边界越需要写清楚,否则要么手工拖慢发布,要么批量操作把判断错误一起放大。