扫描中断后,最可靠的判断依据不是进度条停在哪里,而是已落盘的任务记录里,最后一次成功写入的页面或URL批次。缺少完整数据或权限时,可以只核对已抓取URL清单与站点可枚举URL清单的交集,得出一个保守的覆盖下限;但不能据此推断未出现在清单里的页面一定没被处理,也不能把中断前的抓取量当成全站总量。
出现这种矛盾,通常有两种解释。第一种是软件在内存中累计了本次会话的抓取计数,但中断时没有把队列状态完整写回磁盘,于是界面显示的数字大于实际可核对的已处理量。第二种是扫描确实处理了较多页面,但其中一部分结果因超时、状态码异常或权限不足被丢弃,只留下计数而没有可用的页面明细。两种解释都会让“已完成多少”看起来比实际可用的覆盖范围大,但后续要补的动作完全不同。
要区分它们,需要拿到两类证据:已落盘的任务记录,以及站点层面可以独立枚举的URL清单。前者包括软件写出的抓取日志、导出文件、任务状态文件或数据库表;后者包括服务器访问日志、站点地图、内部链接列表或CMS后台的已发布内容列表。把两者对齐,才能判断中断前真正处理了哪些URL。
在没有服务器日志权限、也无法重新完整扫描的情况下,仍可以执行一个最小动作:从站点地图或内部链接中导出一份可枚举URL清单,与软件已落盘的URL清单做交集,并记录交集数量、差集方向和采样时间。这个动作的结果会直接影响下一步:如果交集覆盖了主要栏目和模板页,可以先用这批数据做局部判断;如果交集只集中在少数目录,说明已覆盖范围不足以代表全站,应先补抓缺失目录,而不是急着分析排名变化。
假设一个站点有A、B、C三个栏目,中断后落盘清单里A栏目URL较完整,B栏目只有列表页,C栏目为空。此时能说的是“A栏目有可核对覆盖,B、C栏目覆盖不足”,不能说的是“全站已覆盖约三分之一”。因为C栏目为空可能来自未抓取,也可能来自权限限制或robots规则,需要单独核对原因。
已覆盖范围只能说明哪些URL在中断前被处理过,不能直接推出全站排名表现、收录状态或内容质量问题。抓取量归零或明显偏低,除了中断本身,还可能是任务被限速、目标站点返回异常、权限中途失效或软件队列提前结束。要判断这些原因,需要看中断前后的状态码分布、请求间隔和错误类型,而不是只看总量。
另外,已覆盖URL清单里的页面也不等于已经被搜索引擎处理。扫描工具看到的是它自己请求到的响应,和搜索引擎的抓取、索引是两套记录。因此,用中断后的扫描结果去判断收录或排名,需要先明确这只是工具侧覆盖,不是搜索侧覆盖。
核对完成后,建议按覆盖缺口决定动作:缺口集中在少数目录时,先补抓这些目录并保留新的落盘记录;缺口分散且无法补抓时,改用站点地图和访问日志做交叉核对,并把结论限定在可枚举范围内。每次补抓后重新做一次交集核对,观察缺口是否缩小。这样做的结果是,后续无论继续分析还是重新扫描,都有可对照的覆盖基线,而不是依赖一个中断时留下的进度数字。