判断采集是否遗漏,核心不是看“总量够不够”,而是核对三条证据链是否对得上:站点自己声明的可抓取URL集合、服务器日志里实际被请求的URL集合、以及最终进入索引或分析库的URL集合。三者的差集,就是遗漏候选。多人协作时,把这三份清单固定成同一格式,谁查哪一列、交付什么文件写清楚,返工就会明显减少。
要查什么:本次分析范围内的全部候选URL,而不是只导出已收录的部分。
怎么查:从站点地图、站内链接爬取结果、CMS后台已发布内容列表三个来源分别导出,合并去重后作为基准清单。每条至少保留URL、来源、内容类型、发布时间、canonical指向五个字段。
结果说明什么:如果三个来源的数量差异很大,说明基准本身不完整,此时算出的“遗漏率”没有意义。先补齐基准,再进入下一步比对,否则后面所有结论都会偏。
要查什么:基准清单里哪些URL从未被搜索引擎爬虫请求过。
怎么查:按爬虫UA和IP段过滤日志,提取被请求的URL,与基准清单做差集。差集里再细分:从未出现、只请求过一次、只请求了非200状态。
结果说明什么:从未出现且站内无任何内链指向的URL,属于发现路径缺失;有内链但从未被抓取的,需要检查是否被robots规则、noindex或超时阻断。只请求一次且状态异常的,属于抓取失败而非遗漏。注意日志只反映请求,不等于内容被收录。
要查什么:同一批URL在搜索引擎报告、站内统计工具、第三方估算中的数量是否一致。
怎么查:分别导出三方的URL列表,做交集与差集。重点看差集里的URL是否被标为“已发现但未编入索引”“已抓取但未编入索引”或类似状态。
结果说明什么:第三方估算流量、搜索引擎报告与站内统计口径不同,不能互相替代。第三方估算偏低不代表采集遗漏,可能只是抽样或模型差异。只有搜索引擎自己给出的状态说明,才能作为判断索引环节的直接依据。若某一方无法导出URL级清单,就只把它作为参考,不作为结论来源。
假设某栏目有100条已发布内容,基准清单100条。日志差集显示8条从未被请求,其中6条没有任何站内链接,2条被robots规则屏蔽。索引报告显示另有5条处于“已发现未编入索引”。此时可判断:6条属于发现路径缺失,2条属于主动排除,5条属于索引环节待观察,而不是笼统地说“遗漏了13条”。这个区分决定了后续动作是补内链、改规则还是等待重新抓取。
这套方法适用于内容量可枚举、有日志权限、多人分工的站点。若站点URL数量极大或参数组合无限,需要先按模板或栏目抽样,再推及整体,并明确标注抽样比例。判断结果只有三类:发现路径问题、抓取受阻问题、索引未编入问题。三类对应的修复动作不同,混在一起报“采集遗漏”会导致执行方向错误。
下一步:把上面八项做成一张共享表格,指定每项的唯一负责人和交付格式,先跑一遍基准与日志的差集,确认差集分类无误后再分派修复任务。