先给结论:升级后评分变化,通常不是“旧分数错了”或“新分数对了”,而是评分口径换了。你需要先判断这次变化属于同一口径下的数据回填,还是新规则重新计算了历史数据。前者只看增量趋势,后者必须把升级前和升级后的分数分开看,不能直接连成一条曲线。
假设你在升级前导出过一份页面清单,记录了每个页面的评分。升级后重新导出,发现大部分页面的分数都变了,但排序大致没变。这种情况最容易被误读成“工具变准了”或“旧版本有 bug”。
更合理的解释是:新版本改变了评分的计算维度或权重。比如旧版把某类问题算作扣分项,新版把它降级为提示项,或者反过来。分数整体平移,说明变化来自规则本身,而不是你的页面在这段时间里发生了什么。
判断方法很简单:找几个升级前后都没有改动过的页面,对比它们的分项明细。如果多个分项同时变化,且变化方向一致,基本可以确认是口径调整,而不是内容质量波动。
这是最常见的情况。工具升级时,往往会用新规则回算历史数据。结果是:你看到的“当前分数”其实是用新标准重新打的,而不是旧标准下的原始记录。
这种解释成立的证据是:
如果符合这些特征,你下一步该做的不是去“修复分数”,而是先确认新规则下哪些扣分项是真正需要处理的。把旧分数当作历史参考,把新分数当作当前基线,分开记录。
另一种可能是:评分规则没大改,但工具采集的数据范围变了。比如升级后开始纳入更多页面、更多查询词,或者把统计窗口从 28 天改成 90 天。这会让同一页面的评分因为分母变化而改变。
这种解释成立的证据是:
要区分这两种解释,可以做一个动作:在升级后的工具里,把统计时间窗口手动调成和升级前一致,再看分数是否接近。如果接近,说明是时间窗口问题;如果仍然差异很大,说明是规则本身变了。
总分变化最容易误导人。你需要看的是分项。具体做法是:
这个动作的结果会直接决定你下一步的方向:如果变化集中在规则调整的分项上,你只需要按新规则重新排优先级;如果变化分散且没有规律,才需要怀疑数据采集或统计口径的问题。
假设某个页面在升级前评分 82,升级后变成 67。你检查后发现,页面内容、标题、内链都没有改过。进一步看分项:旧版把“缺少结构化数据”扣 5 分,新版把它扣 15 分;旧版把“外部链接数量”作为加分项,新版把它移出了评分模型。
在这个假设里,分数下降不是因为页面变差了,而是因为新规则对某些项目的权重变了。你能做的实际动作是:确认新规则下哪些扣分项仍然在你的控制范围内,优先处理那些新规则明确加重的项目。至于被移出评分模型的项目,就不必再花时间。
需要提醒的是,不同工具的评分模型、更新频率和历史数据回算方式都不一样。上面这个例子的数字只用于说明比较方法,不代表任何具体工具的实际表现。具体规则需要以你所用工具的更新说明和分项定义为准。
如果确认是规则变了,并且历史数据被重新计算过,那么升级前的分数和升级后的分数不能直接比较。你应该以升级后的第一次导出作为新基线,之后的分数变化才具有可比性。
如果确认只是时间窗口或数据范围变了,且你可以手动调回一致的口径,那么旧趋势仍然有参考价值,但要在记录中注明口径差异。
无论哪种情况,都不要把“分数变了”直接等同于“优化有效”或“优化失败”。分数只是工具按某套规则给出的评估结果,它和实际流量、转化之间的关系需要单独验证。把评分变化当作排查线索,而不是最终结论,才能避免在规则调整后做出错误判断。