先给结论:如果报告页数比实际对象多,通常不是“多抓了词”,而是同一对象被拆成了多行。去重前要先判断多出来的是同一对象的重复记录,还是本来就该分开的变体。判断依据不是页数本身,而是每条记录能否还原到唯一的目标对象。
第一种解释是数据层面的重复。典型情况是同一个查询词对应多个落地页、同一个页面被不同设备或地区各记一行、同一对象在两次抓取中各留一份快照。这类重复的特征是:除少数字段外,其余字段高度一致,合并后不损失信息。
第二种解释是对象本身就不唯一。比如一个词分别投放在搜索引擎和平台推荐两个渠道,或同一词对应不同市场、不同语言版本。这类行看起来也“像重复”,但合并会抹掉渠道或地区的差异,导致后续判断失真。
两种解释都成立,取舍点在于:你后续要用这份报告做什么决策。如果只是看整体覆盖,合并更省事;如果要按渠道或地区分配动作,就不能合。
不要凭页数下判断,去看这几组可核对的字段:
一个假设例子:某次查询导出300行,实际对象200个。检查后发现其中80行是同一URL在两个设备维度下的记录,另20行是同一对象在两次抓取中的快照。前者应保留、按维度分组;后者可只保留最新一次。这样处理后行数回到200,且没有丢失维度信息。
把对象分成三类,处理方式不同:
动作与结果的关系:先做URL规范化,再按对象类型选主键去重。如果跳过规范化直接去重,带参数的同一页面会被当成两个对象,页数依旧偏高;规范化之后再去重,页数才会回落到接近真实对象数。
如果去重后页数还是对不上,按顺序检查:
需要说明的是,页数下降或某项统计归零,并不能单独证明去重正确。它也可能是筛选条件变化、导出范围缩小或抓取未完成造成的。要确认去重是否合理,应回到对象标识和维度字段,而不是只看总数。
具体工具的去重入口、字段名称和导出选项因产品而异,使用前需以该工具当前说明为准。对未知工具,按“先补对象标识、再定主键、最后按维度分组”的通用顺序评估即可。最终判断标准只有一个:去重后的每一行,是否还能唯一对应一个你要跟踪的实际对象。