先给一个有条件的结论:当入口页面的网址收录正常、而更深层页面批量不收录时,断点通常不在入口本身,而在入口到深层之间某一段可复现的链路环节。定位方法是沿一次真实抓取路径逐段验证,而不是重新提交入口或反复刷新站点地图。这个结论只在“入口页可被抓取且深层页有实际入链”的前提下成立,若深层页根本没有可发现路径,问题性质完全不同。
这两类原因的修复动作方向相反,必须先用证据分开。可区分的信号包括:
注意,请求量归零不能单独证明“链接没被发现”。它也可能是抓取预算被入口页和高频页占用、站点整体响应慢导致调度后移,或日志采样与保留周期不完整。需要至少两个独立证据交叉,例如日志缺失同时伴随内链渲染后不存在。
把入口页到目标深层页的路径拆成可单独检查的段,常见分段是:入口页HTML、内链所在容器、跳转或参数、目标页响应、目标页可见内容。逐段动作与结果判断如下:
每一步的结果决定下一步:状态码异常就先修可达性;原始HTML无链接就先解决可发现性;内容不一致就先解决渲染可见性。跳过前一步直接改内容,往往无效。
假设某站点入口页与栏目页收录正常,深层文章页批量不收录,按上述路径排查发现内链正常、响应200、内容可见,于是判断为“内容质量问题”。但如果这些深层页全部依赖同一个参数化列表页进入,而该列表页对爬虫返回的是精简版、不含深层链接,那么真实断点仍在发现环节,只是被入口页的正常表现掩盖了。这说明:入口正常不能推断中间层正常,样本页正常也不能推断规模化后一致。当深层页的入链集中在少数模板页时,必须单独验证这些模板页对爬虫的输出版本,而不是只测单个文章页。
个别样本成立不等于规则可照搬。以下条件会让同一修复动作失效:深层页数量级变化后抓取调度优先级改变;模板改版导致部分页面渲染路径不同;多语言或多域名结构中链接指向了非目标版本。此时应把验证单位从“单页”提升到“模板或链接来源分组”,按分组对比日志与响应,找出例外集中出现的组,而不是继续逐页抽查。
选定一个模板分组,固定入口页、固定一条深层路径,连续记录该路径各段的响应与日志表现,持续到能区分“偶发”与“稳定复现”。若稳定复现,修复点就是该段;若始终无法复现,说明断点可能受抓取时机或调度影响,应转向检查站点整体响应与抓取频率,而不是继续修改深层页本身。robots.txt的限制只影响抓取,不等于可靠的索引移除;站点地图提交也不保证收录,这两点不能作为断点已修复的证据。