先给结论:升级后评分变化,通常不是“数据变差了”,而是评分规则、数据口径或样本范围至少有一项发生了变化。要解释差异,先把升级前后的评分拆成“规则版本、取数范围、时间窗口”三个可核对字段,再判断变化来自哪一层。若三者都一致而分数仍变,才需要怀疑数据本身。
两种常见解释需要分开:一种是评分算法或权重调整,导致同样的原始数据算出不同分数;另一种是取数口径变化,比如升级后默认统计范围、时间窗口或去重逻辑改变。前者表现为“原始指标没动、分数动了”,后者表现为“原始指标本身也变了”。
可核对的证据很简单:找一条升级前后都存在的记录,把它的原始指标逐项列出来。如果原始指标数值一致,只有总分和分项权重不同,基本可判定为规则变化;如果原始指标本身就有出入,则优先排查口径。这里要注意,抓取量或请求量下降并不能单独证明规则变严,也可能是采集频率、去重策略或页面结构变化导致的。
条件一:只影响展示分,不影响后续动作。此时不必急于回滚或重配,先把新旧两版评分对同一批记录跑一遍,记录分差分布。若分差集中在某一分项,说明该分项权重被调整,后续优化重点随之转移。
条件二:评分直接触发告警、预算分配或任务派发。这类场景下,评分变化会改变实际动作,必须先冻结自动执行,再人工核对触发阈值。假设某条记录旧版评分为“中”,新版升为“高”并触发加投,而原始转化数据并未变化,那么这次升级带来的只是动作变化,不是效果变化。此时应回看阈值定义,而不是直接追加投入。
选择依据是:评分是否被下游系统消费。被消费的评分,优先保证动作可控;仅用于查看的评分,优先保证口径可比。
假设某推广账户在升级前有 100 条记录,平均分 62;升级后同样 100 条记录,平均分 55。先不要下“效果下滑”的结论。把记录按“升级前后都出现”筛选,若这部分平均分从 62 变为 58,说明规则对存量记录也产生了影响;若存量记录平均分不变,而新增记录拉低了整体均值,则差异来自样本构成,不是规则本身。这个比较方法的关键是固定样本,而不是比较两个不同集合的均值。
第一步动作:导出一份同时包含新旧评分、原始指标、记录标识的对照表。结果若显示分差与某个原始指标高度同步,下一步就修口径;若分差与任何原始指标都不同步,下一步就查规则版本说明或权重配置。
第二步动作:对分差最大的前若干条记录逐条核对。若这些记录恰好是近期新增或近期修改过的,优先怀疑采集与更新时点差异;若它们长期存在且从未改动,则规则变化的可能性更高。
第三步动作:在确认原因前,不要用新版评分直接对比历史报表。可以把历史报表标注为“旧规则口径”,新版数据单独成表,等规则稳定后再决定是否回溯换算。这一步的结果决定了后续报表能否合并,也决定了团队是否需要对旧结论重新解读。
有些差异既不是规则也不是口径,而是时间窗口错位。例如升级发生在月中,前后两次统计覆盖的天数不同,评分自然不可比。还有一类例外是记录状态变化,比如某条记录在升级期间被暂停或删除,导致参与评分的集合改变。
遇到这类情况,正确做法是先对齐时间窗口和记录状态,再谈评分。若对齐后差异仍然存在,且无法从规则说明中找到依据,应把问题记录为待确认项,向工具方核对具体版本说明。具体功能的现行状态、入口位置和计费方式需要以实际核对为准,不要依据旧教程推断。
最终判断标准只有一条:升级前后的评分,是否建立在同一套规则、同一批记录、同一个时间窗口上。三者对齐后仍有差异,才值得继续追查;三者未对齐,先别急着解释分数。