网站抓取规则_改版或迁移时应核对什么

📍 WDQWDWQD987AAAAA:216.73.216.69
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /6a69251076b1.html
📄

网站抓取规则_改版或迁移时应核对什么

改版或迁移时核对网站抓取规则,核心是确认三件事:搜索引擎是否还能发现新地址、是否被允许抓取新地址、旧地址是否给出了正确的去向。任何一项出错,都可能导致新页面长期不被抓取,而旧页面又不断被访问。下面是一份可执行清单,每项都说明查什么、怎么查、结果说明什么。

查 robots.txt 是否误挡了新目录

要查的是:新站或新目录是否被 robots.txt 的 Disallow 规则挡住。怎么查:分别用 https://新域名/robots.txt 和 https://旧域名/robots.txt 打开文件,逐条对照 Disallow 路径与新站实际目录。结果说明:如果新站目录被 Disallow,抓取会被直接拒绝,此时页面即使能通过浏览器访问,也不会被抓取。注意,robots.txt 的抓取限制只针对爬虫抓取,不等于可靠的索引移除;如果目标是让旧页面从索引消失,应使用合适的移除或跳转方案,而不是只靠 robots.txt。

查站点地图是否指向新地址

要查的是:sitemap 中的 URL 是否全部为新域名或新路径,是否返回 200。怎么查:打开 sitemap 文件,抽查其中若干条 URL,确认它们能正常打开、不是旧地址、不是重定向链。结果说明:sitemap 是发现入口之一,但它不保证收录;如果 sitemap 仍列旧地址,爬虫会持续访问旧链接,浪费抓取预算,也延迟新页面被发现。多人协作时,应把 sitemap 的更新列为迁移交付项,而不是迁移后补做。

查旧地址的跳转与状态码

要查的是:旧 URL 返回什么状态码,跳向哪里。怎么查:用命令行或浏览器开发者工具查看响应头,重点看 301、302、404、200。结果说明:301 表示永久跳转,适合已确定不再恢复的旧地址;302 是临时跳转,不适合长期迁移;404 表示旧地址已无对应内容;200 表示旧地址仍可访问,可能造成新旧两份内容并存。若旧地址跳转到不相关页面,或跳转链超过一跳,都会削弱传递效果,应尽量做到一跳到位、目标相关。

查 HTTPS 与协议、主机名是否统一

要查的是:同一页面是否存在 http 与 https、带 www 与不带 www 等多个版本同时可访问。怎么查:手动输入几种组合访问,观察是否都跳转到同一个规范地址。结果说明:多版本并存会让抓取信号分散,应统一到一个主地址并做跳转。需要明确,HTTPS 不保证安全无漏洞,也不保证排名;它只是迁移时应当核对的协议一致性项。

查内链与入口是否已指向新地址

要查的是:站内导航、面包屑、相关推荐、页脚等位置的链接是否还指向旧地址。怎么查:抽查首页、栏目页、详情页各若干,查看链接目标。结果说明:内链是爬虫发现新页面的主要路径之一,如果内链仍指向旧地址,爬虫会不断走旧路,新页面发现速度变慢。多人协作时,应把内链更新作为独立检查项,避免只改模板却漏掉手工插入的链接。

多人协作时的交付核对方式

建议把上述检查做成一张表,每行包含:检查项、负责人、检查方法、预期结果、实际结果、是否通过。迁移前查一次,迁移后立即查一次,上线一周后再抽查一次。判断标准可以统一为:robots.txt 不误挡新目录、sitemap 只列新地址、旧地址一跳到位且目标相关、协议与主机名统一、内链指向新地址。任何一项不通过,先修复再继续下一轮检查,避免返工。

下一步:拿这份清单对照你当前迁移项目的实际配置,逐项填写实际结果,把不通过的项直接转成修复任务并指定负责人。

图1 图2

nginx