排查重复页面,核心不是先买付费工具,而是先用站内搜索指令、日志和URL规则做交叉比对,把“内容相同但网址不同”的页面找出来,再判断是保留、合并还是跳转。对预算有限的站长来说,顺序应该是:先查已知重复,再查参数和大小写变体,最后才考虑付费爬虫。
重复页面不等于必须全部删除。先分清三类:
www、带与不带结尾斜杠。判断依据是“用户是否需要这个地址独立存在”。如果两个地址给用户看到的内容几乎一样,且没有独立导航价值,就属于优先处理对象。
第一步,用站内搜索指令抽样。在搜索引擎输入site:你的域名 一段独特正文,观察返回结果里是否出现多个URL指向同一段内容。这个方法只能抽样,不能保证覆盖全站,但适合先找明显问题。
第二步,检查URL变体。手动访问以下组合,看是否都返回200状态码且内容相同:
www与不带www?from=xxx、?sort=等跟踪参数如果多个变体都能正常打开,说明缺少规范化处理。此时应选定一个首选地址,其余做301跳转,或在页面<link rel="canonical">中指向首选地址。注意:canonical是提示,不是强制指令;301跳转更明确,但只适用于确实不再需要独立访问的地址。
第三步,查服务器日志或统计后台。看搜索引擎抓取了哪些带参数的URL、哪些返回200。日志能反映真实抓取情况,比单纯猜测更可靠。若没有日志权限,可用统计工具里的“着陆页”报告,按参数筛选访问量低但被抓取多的地址。
处理重复页面有四种常见动作,适用条件不同:
www、斜杠变体。假设一个服装站有/shirt?color=red和/shirt?color=red&sort=price两个地址,内容相同,只是排序不同。若排序结果对用户有价值,可保留访问但用canonical指向不带排序参数的主列表页;若排序只是临时视图,直接301到主列表页更省事。
改动后不要立刻下结论。复查应关注三点:
复查工具可以继续用站内搜索指令抽样,也可以看日志中旧地址的抓取频率是否下降。若旧地址仍被大量抓取,检查跳转链是否过长、是否有多层跳转,或canonical是否写错。
下一步,先整理一份URL变体清单,把带参数、大小写、斜杠的地址各抽10条手动访问,记录状态码和页面标题,再决定哪些跳转、哪些加canonical。这份清单比盲目安装插件更省钱,也更接近真实问题。