上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常访问页面、页面没有被误设为禁止收录、希望被收录的网址能进入抓取队列。对岳阳网站建设这类项目,最优先做的不是全站逐页检查,而是先看 robots 规则、首页与栏目页的可访问性、以及是否误加了全局 noindex。时间有限时,先处理这三项,再抽样验证内页和跳转。
打开站点根目录下的 robots.txt,检查是否存在 Disallow: /。如果整站被禁止抓取,后续所有索引配置都失去意义。测试时不要只看文件内容,还要用抓取测试工具请求首页和一条栏目页,确认返回的是正常内容而不是被拦截。
适用条件是站点已经能通过公网访问。判断结果是:抓取测试显示可访问、返回状态正常,说明 robots 未阻断该路径;若显示被 robots 拦截,应先修改规则并重新测试,再继续下一步。
在浏览器中查看首页、主要栏目页和一篇内容页的 HTML 源码,搜索 <meta name="robots">。若出现 noindex,该页不会被索引。常见误操作是开发环境遗留的全局 noindex 被带到线上,或模板给所有页面统一加了 noindex。
如果站点使用 HTTP 头控制索引,还要检查响应头中是否出现 X-Robots-Tag: noindex。它与 meta 标签作用类似,但更容易被忽略。
抓取与索引是两步:先能抓,才可能被索引。检查首页和栏目页是否返回 200 状态码,而不是 301 跳转到登录页、404 或 500。若站点刚上线,还要确认服务器没有对搜索引擎返回验证码页或空内容。
可以按以下顺序执行:
判断结果是:状态码为 200 且内容正常,说明该网址具备被抓取的基础条件;若返回 3xx,要确认跳转目标是否也是希望收录的地址;若返回 4xx 或 5xx,应先修复再提交。
sitemap 应只列出希望被收录的规范网址。常见问题是同时列出带 www 和不带 www 的版本、http 和 https 的版本,或列出已被 noindex 的页面。内部链接也应指向最终地址,避免多次跳转。
检查项包括:sitemap 中的网址是否与页面实际规范地址一致;首页链接是否指向最终域名;栏目导航是否直接指向栏目页而非跳转页。若发现不一致,先统一规范地址,再重新生成 sitemap。
提交 sitemap 后,不要以“提交成功”作为收录完成的判断。可观察的验收信号是:抓取测试能正常获取页面;站点根目录 robots.txt 可访问且规则正确;重要页面没有 noindex;sitemap 中网址返回 200。若一段时间后仍未收录,优先复查抓取状态和页面质量,而不是反复提交同一网址。
下一步:按“robots → noindex → 状态码 → sitemap”的顺序做一次全站抽样检查,把发现的问题直接记录到上线清单中,逐项修复后再提交。