先给结论:如果草稿页只是被发布系统带出、但没有任何内链或导航指向它,优先按“URL 级”圈定范围,逐个确认这些 URL 是否被抓取、是否出现在站内搜索结果或站点地图中;只有当草稿页被栏目页、首页或站点地图引用时,才需要按“模板级”排查,因为影响会沿着链接关系扩散到同模板的其他页面。判断哪种做法成立,取决于草稿是否获得了可被发现的入口,而不是取决于它是不是“新页面”。
URL 级排查的成立条件是:草稿 URL 没有被任何已发布页面链接,站点地图也没有自动收录它。代价是逐个 URL 核对耗时,但如果草稿数量少,这是最省事且不会误伤其他页面的做法。具体动作是导出发布记录里的草稿 URL 列表,再到站点地图和站内搜索里逐一比对;如果比对结果为空,就可以只处理这些 URL,不必改动模板或全站配置。
模板级排查的成立条件是:草稿页与正常页面共用同一套模板、同一批导航或同一个自动生成的列表页。代价是改动范围大,可能影响正常页面的展示逻辑,所以只应在确认草稿被模板自动引用时才采用。动作是先检查栏目页、首页和站点地图的生成规则,确认草稿是否会被自动写入;如果会,就先停掉自动写入,再处理已经生成的链接。
反例是:草稿页虽然没有任何内链,但发布时被站内搜索索引或外部抓取工具直接访问过。这种情况下,URL 级排查会漏掉已经发生的抓取,模板级排查又没有必要。此时应把范围重新定义为“URL 加访问日志”:先看这些草稿 URL 是否出现过访问记录,再决定是只做 URL 处理,还是连同站内搜索的索引一起清理。这个反例说明,有没有内链不是唯一判据,是否被主动访问过同样会改变影响范围。
假设一次发布带出 8 个草稿 URL,其中 2 个出现在站点地图,6 个只存在于发布记录,且都没有内链。按 URL 级处理时,先清理这 8 个 URL,再重新生成站点地图;结果是站点地图里的 2 个草稿消失,另外 6 个不再被发布记录带出。如果先按模板级处理,可能会改动站点地图的生成规则,导致正常页面也被排除,反而需要回滚。这个例子的数字只用于说明比较方法,不代表任何实际项目的规模。
先做一次最小验证:只处理草稿 URL 本身,并记录处理前后的站点地图条目数和访问日志中这些 URL 的出现次数。如果处理后的条目数减少、访问记录不再新增,说明 URL 级判断成立,后续只需在发布流程里加一道草稿过滤;如果处理后的条目数没有变化,或者访问记录仍在增加,说明草稿被其他系统引用,下一步应转向检查模板和自动生成规则。比较前后数据时,要考虑季节和搜索需求变化带来的自然波动,不能把一次归零直接当成处理正确的证据。