用网站安全检测软件判断采集是否遗漏,核心不是看“扫描了多少个页面”,而是看“扫描结果能否和站点实际暴露面一一对应”。如果软件只报告发现了什么,却不说明哪些入口没被覆盖,遗漏就无法判断。正确做法是先建立一份可核对的URL与参数清单,再让检测软件按清单跑,最后对比“清单应有”和“报告实有”的差集。
判断遗漏的前提是有一个独立于检测软件的基准。这个基准可以来自站点地图、服务器访问日志、应用路由配置或爬虫抓取结果。注意,第三方估算流量、搜索引擎报告与站内统计口径不同,不能互相替代。基准清单至少应包含:页面URL、带参数的动态地址、表单提交入口、API接口路径、上传与登录等功能点。
如果基准本身不全,后面所有对比都会失真。因此准备阶段要先回答:这次检测覆盖的是整个域名,还是某个子目录?是否包含需要登录后才能访问的页面?是否包含只在特定参数下才出现的接口?
网站安全检测软件常见的采集方式有两种,适用条件不同。
实际操作中,最稳妥的是先爬虫发现,再和基准清单做差集,把差集补进定向采集。关键一步是记录每个URL的采集状态:成功、超时、被拦截、重定向到其他地址,而不是只记录成功项。被拦截和超时往往正是遗漏的高发区。
验证时不要只看“共采集N条”,要看三个对比:
可以做一个简单核对:把基准清单和报告结果各导出一列URL,去重后排序,用表格的匹配函数找出只存在于基准、不存在于报告的部分。这部分就是最直接的遗漏候选。对每个候选再人工确认一次:是软件没抓到,还是该地址本身已失效。
判断结果时要注意,单个指标不能还原搜索或采集算法的全貌。采集遗漏是覆盖问题,不是排名问题,两者不要混在一起看。
采集范围会随站点更新而变化,所以基准清单和采集规则都要定期同步。建议每次改版、新增接口或调整参数后,重新跑一次差集对比。把每次的差集结果留存,就能看出遗漏是偶发还是集中在某类页面。
如果发现遗漏集中在需要登录的页面,检查采集账号权限;如果集中在带参数的地址,检查参数枚举规则;如果集中在JavaScript渲染的内容,检查采集方式是否执行了脚本。区分“可能原因”和“已经定位的原因”:只有通过对照请求日志或响应状态确认后,才能说某处确实被漏掉。
下一步,先导出你当前的基准URL清单和最近一次检测报告,做一次差集对比,把只出现在清单里的地址单独列出来,再逐条确认采集状态。