上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常访问页面、页面愿意被抓取、抓取后能进入索引。对山西做网站的项目来说,多人协作时最容易出问题的地方不是代码本身,而是测试环境的屏蔽规则被带到了正式环境,或者正式环境反而忘了放行。交付前应逐项验证,留下可复查的记录。
在动手检查之前,先把页面分成三类,后续所有核对都围绕这个分类进行:
这份清单应由项目负责人和内容负责人共同确认,而不是只由开发判断。多人协作时,常见返工来源就是开发按“全部放行”处理,上线后才发现大量无价值页面被收录。
打开正式域名的 /robots.txt,确认没有 Disallow: / 这类全站屏蔽。如果站点分测试环境和正式环境,重点确认正式环境的 robots.txt 是放行版本,而不是从测试环境复制过来的。同时确认 Sitemap 地址写在 robots.txt 中,且指向正式域名。
用浏览器查看页面源码,确认没有意外的 <meta name="robots" content="noindex">。这类标签常出现在模板中,一旦被继承到所有页面,整站都不会进入索引。检查时应抽查首页、栏目页、详情页各一个,而不是只看首页。
确认 canonical 指向的是正式域名,且与当前访问地址一致。常见问题是 http 与 https 混用、带 www 与不带 www 混用,导致同一内容出现多个地址。上线前应确定唯一主域名,并让其他形式跳转到主域名。
直接访问 Sitemap 地址,确认返回正常、包含正式域名下的 URL、没有测试域名残留。Sitemap 不是收录保证,但它能帮助抓取工具发现页面,属于交付时应提供的基础文件。
配置改完后不能只看代码,要用外部视角验证。以下步骤可以实际执行:
curl 请求页面,确认返回状态码为 200,而不是 403、404 或 500。判断结果的标准很简单:状态码正常、内容正确、屏蔽规则与页面分类清单一致。如果某项不符,先定位是服务器配置、模板输出还是 CDN 缓存导致,再决定修改位置,不要直接改 robots.txt 掩盖问题。
上线不是终点。交付后应约定一个复查时间点,观察抓取工具是否开始访问、索引量是否逐步增加、是否有大量无价值页面被收录。如果发现应屏蔽的页面出现在索引中,先检查是 robots.txt 规则写错,还是页面本身没有加 noindex,再补相应配置。
多人协作的项目建议把上述检查项做成一张交付清单,每项标注负责人和验证结果。这样即使人员变动,也能快速判断当前配置状态,减少重复沟通和返工。
下一步可以直接从 robots.txt 和首页 meta robots 两项开始核对,这两项出错的影响面最大,也最容易在环境切换时被忽略。