上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否正常抓到页面、抓到的页面是否被允许收录、收录的地址是否唯一且正确。具体做法是在测试环境或预发布环境完成一轮“可抓取性检查”,把 robots.txt、meta robots、canonical、sitemap、状态码逐项对照,确认无误后再切换正式域名。多人协作时,建议把这份检查表写进交付文档,由开发、内容、SEO 三方各签一次,减少上线后返工。
抓取指搜索引擎的爬虫能否请求到页面并拿到内容;索引指抓到的内容是否被存入搜索结果库。两者常被混为一谈,导致排查方向错误。
<meta name="robots" content="noindex"> 或响应头里的 X-Robots-Tag 阻止了收录。判断顺序应是先看抓取,再看索引,最后看规范化。跳过前两步直接改 canonical,往往白费功夫。
以下项目建议在预发布域名上先跑一遍,切换正式域名后再抽查一次。每一项都要记录“谁检查、什么时候、结果如何”。
Disallow: /。测试环境屏蔽全站是合理的,但这份文件不能带到正式环境。检查方式是直接访问 /robots.txt,确认允许规则和 sitemap 地址。noindex 或 nofollow。要分别检查 HTML 源码和 HTTP 响应头,因为两者可能只出现一个。抓取与索引配置横跨开发、运维、内容和推广,最容易出现“以为别人检查过了”。可按以下方式拆分:
交付时附一份检查记录:每项写明确认时间、确认人和结果截图或日志片段。这样上线后若出现收录异常,能快速定位是哪一环遗漏,而不是全员重新排查。
假设某舟山企业的官网从测试域名 test.example.com 切换到 www.example.com,上线前可以这样核对:
https://www.example.com/robots.txt,确认没有 Disallow: /,且 sitemap 指向正式域名。curl -I 查看响应头,确认没有 X-Robots-Tag: noindex,状态码为 200。http://example.com 和不带 www 的版本,确认都 301 到首选地址。如果以上都通过,说明抓取与索引的基础配置已经就绪;若某一项不通过,先修复该项再重复核对,不要跳过。
如果网站只有少量页面、没有多语言和多域名,检查项可以压缩到 robots.txt、canonical、状态码三项。但只要涉及以下任一情况,就不建议简化:
判断标准很简单:只要存在“同一个内容可能对应多个地址”的情况,就必须做完整核对,否则后续排查成本远高于上线前多花的一小时。
下一步建议把上述清单整理成一页交付检查表,在切换正式域名前由开发、运维、内容三方各确认一次,并把确认结果存档,作为后续收录异常时的第一手排查依据。