用网站死链检查工具识别配置冲突,核心不是等工具报错,而是把爬取范围、允许规则、重定向和跳转目标四类配置放在一起比对:同一路径被两条规则给出相反结论,就是冲突。工具只能暴露结果,冲突要靠规则来源对照才能定位。
要查的是 robots.txt 中的 Disallow 与 Allow、站点地图里列出的 URL、以及站内链接实际指向的路径,三者是否一致。怎么查:把 robots.txt 的规则逐条列出,标出每个路径前缀是被允许还是被禁止;再把站点地图和工具爬取到的 URL 列表导出,按前缀归类。结果说明什么:如果站点地图或内链大量指向被 Disallow 的路径,说明抓取限制与提交范围冲突,搜索引擎可能不抓取这些页面,站点地图的提交也无法改变这一点。注意 robots.txt 的抓取限制不等于可靠的索引移除,已收录页面不会因为新增 Disallow 就自动消失。
要查的是同一源 URL 是否同时配置了多条重定向,以及链上是否出现 A 到 B、B 又回 A 的循环。怎么查:用工具导出每个 URL 的状态码和最终落地 URL,筛选出 3xx 记录,按源地址分组;同一源地址出现两个不同目标,或链长超过两跳,都标记出来。结果说明什么:多目标重定向会让实际落地页取决于服务器匹配顺序,工具每次跑出的结果可能不同;循环则会让抓取停在中间页。判断条件是链上状态码连续为 301 或 302 且最终返回 200,若最终仍为 3xx 或 4xx,说明链没有闭合。
要查的是同一内容页被内链指向的地址、页面内 canonical 声明的地址、以及重定向的落地地址是否一致。怎么查:抽一批重点页面,分别记录三个地址,比较协议、主机名、路径尾斜杠和大小写。结果说明什么:三者不一致时,权重和抓取信号会被拆到多个 URL 上。例如假设某页内链指向 http://example.com/a,canonical 写的是 https://example.com/a/,而服务器又把前者 301 到后者,这属于可收敛的配置;但如果 canonical 指向 https://example.com/b,就与跳转目标冲突,需要人工确认哪个才是目标地址。HTTPS 本身不保证安全无漏洞,也不保证排名,它只是地址一致性检查中的一项。
不同搜索引擎对 robots.txt 规则、canonical 和重定向的处理细节并不完全相同,同一份配置在不同引擎下的表现需要分别核查,不能只看一个工具的输出就下结论。
先修 robots.txt 与站点地图的交叉,再修重定向的多目标与循环,最后统一内链和 canonical 的地址写法。每修一项,用同一工具重跑一次并对比前后差异,确认冲突项数量下降。如果重跑后仍有同一路径被两条规则覆盖,回到规则来源逐条核对,而不是继续增加新规则。
下一步:选一个重点目录,按上面的清单跑一遍,把冲突项写成待办列表,按处理顺序逐条改完再复跑。