先给有条件的结论:如果导出文件里每一行都带稳定对象标识,按标识去重最可靠;如果只有关键词文本,页数不等于对象数,通常只能按文本归一化后近似去重。反例是同一关键词因地区、设备或时间条件不同而必须分别保留,此时强行合并会把有效差异抹掉。下一步动作是先抽样比对两页边界,再决定去重键。
报告页数由导出分页决定,对象数量由查询返回的记录决定。两者不一致常见于三种情况:同一对象在相邻页重复出现;分页大小与记录总数不整除,末页只有少量记录;或者查询条件变化后旧页被重新抓取。判断属于哪一种,不能只看总页数,要看每页首尾记录是否重叠。
可核对的证据是:把第一页最后三条与第二页最前三条并排,看标识或文本是否重复。如果重复,说明分页边界有重叠;如果不重复但总数仍对不上,更可能是过滤条件在两次请求之间发生了变化。此时去重不是第一优先级,先固定查询条件更重要。
有稳定标识时,用标识做唯一键,重复项直接丢弃。没有标识、只有关键词文本时,先做归一化:统一大小写、去除首尾空白、合并连续空格,再按归一化后的文本去重。这样能消除大部分“看起来一样”的重复。
假设一份报告有 120 行、每页 50 行,页数显示 3 页,但实际对象只有 115 个。若第一页末 5 行与第二页首 5 行标识相同,去重后应得 115 行;若标识不同却仍多出 5 行,则要检查是否有两次查询被合并导出。这个例子只说明比较方法,不代表任何具体工具的真实输出。
反例很明确:同一关键词在不同地区、设备或时间条件下返回的是不同对象,这些行虽然文本相同,但属于不同查询维度。把它们合并会让后续分析丢失维度差异。判断是否需要保留,问一句:这些行去掉条件后,是否还能回答原来的问题?如果不能,就不能按文本去重。
另一个容易误判的现象是抓取量或请求量突然归零。它可能来自去重生效,也可能来自查询条件被改窄、接口限流或导出中断。归零本身不能证明去重正确,需要结合抽样比对和条件日志一起看。
完成这四步后,如果行数与预期对象数吻合,就可以进入下一步分析;如果不吻合,优先复查查询条件是否在导出期间被修改,而不是反复调整去重规则。具体工具的导出字段和分页行为需要以你实际使用的版本为准核对。