先给结论:如果自动评分已经能稳定复现你的人工判断,而且差异只落在无关紧要的边界案例上,就该退出人工环节;如果人工判断依赖的是自动评分看不到的上下文,比如页面意图、商业价值、内容时效,那就该保留人工,并把自动评分降级为初筛。真正危险的不是自动评分本身,而是默认它和人工判断等价。
很多团队说不清人工复核在做什么,只笼统说“机器不准”。要决定保留还是退出,先把人工动作拆成三类。
只有第一类适合被自动评分替代。把第二、三类也交出去,短期看不出问题,等业务前提变化时才会集中暴露。
当业务前提发生变化,比如新增了产品线、目标市场调整、内容从引流转向转化,原来的评分逻辑可能已经不再对应真实目标。这时有三条路。
适用前提是:判断结果会直接影响预算、内容方向或对外承诺,且错误代价高。做法是让自动评分先过滤掉明显无关的项,人工只处理剩下的部分。实际动作可以是:先按自动评分排序,人工只复核前若干条和评分处于边界区的条目。结果是人工工作量下降,但关键决策仍有人负责,下一步可以据此观察自动评分漏掉了哪些人工判为重要的项。
适用前提是:人工判断其实有规律,只是没被写进评分规则。比如人工总是优先处理带购买意图的词,而自动评分只按排名位置排序。这时应把意图、页面类型、历史转化线索等维度补进评分,而不是简单退出。结果是评分更贴近真实优先级,人工只需处理规则未覆盖的例外。
适用前提是:业务目标单一、判断标准稳定、错误可逆,且自动评分与人工判断在历史样本上高度一致。如果只是“人手不够”而退出,那不是取舍,是把风险转嫁给后续决策。
不要凭感觉决定。可以取一段历史数据做对照:把过去人工判断为“需要处理”和“可以忽略”的条目各抽一批,看自动评分能否把它们分开。
假设某团队过去三个月人工标记了两百个条目,其中六十个判为需要处理。如果自动评分在这批数据上把大部分需要处理的条目排在前面,且被误判的多是影响很小的长尾词,那么退出的条件基本成立。反过来,如果自动评分把若干高价值页面判为低优先级,而原因正是它看不到页面意图,那就说明评分口径缺失,应该先改写而不是退出。
这里要注意:请求量、抓取量或某个指标归零,不能单独证明自动评分正确。它也可能来自数据源延迟、口径调整或采集范围变化。判断依据应该是评分结果与人工结论的一致程度,而不是某一个数字的涨跌。
可执行的做法是保留人工评分,同时并行运行自动评分,但暂时不让自动评分影响任何决策。持续一段时间后,比较两者在“重要项”上的重合度。
这个动作的结果直接决定下一步:重合度高就逐步退出人工,重合度低就改写评分逻辑,而不是在两者之间反复摇摆。具体工具是否支持并行评分、能否导出对照数据,需要按你实际使用的工具核对,不同工具的能力差异较大。
即使决定退出,也建议保留一个低成本的抽查机制,比如定期人工复核评分最高和最低的两端。原因是业务前提会再次变化,自动评分不会主动告诉你它已经失效。抽查发现的异常如果集中在某一类条目,就是评分需要更新的信号;如果长期没有异常,才可以继续维持自动评分。
判断标准始终是:自动评分是否仍在替你回答原来那个人工问题。如果它回答的是另一个问题,保留人工或改写评分,比直接退出更稳妥。