核对抓取限制,不是看百度是否“已经收录”,而是确认百度蜘蛛在访问你的页面时,是否被服务器、robots.txt、页面标签或权限设置挡住。多人协作时,最容易出现的误解是:同事说“页面能打开”,就认为抓取没问题。实际要分别核对“人能否访问”和“百度蜘蛛能否抓取”两件事。
浏览器访问正常,只说明普通用户链路通。百度蜘蛛抓取时,可能遇到不同的 User-Agent、不同的 IP 来源、不同的访问频率。常见拦截来源包括:
Disallow: / 或屏蔽了关键目录;<meta name="robots" content="noindex"> 或 nofollow 设置;这些原因可能同时存在,不能只凭一个现象断定唯一原因。核对时要逐项排除,而不是直接改代码。
多人协作交付时,建议按下面顺序检查,并把结果写进同一份记录,减少返工。
你的域名/robots.txt,确认没有误屏蔽目标目录。若屏蔽了 /,百度蜘蛛不会继续抓取全站。noindex。如果存在 <meta name="robots" content="noindex">,该页不会被当作可索引内容。假设某页面浏览器能打开,但服务器日志中百度蜘蛛访问返回 403。此时可以判断:抓取限制很可能来自服务器或 CDN 规则,而不是 robots.txt。下一步应检查防火墙、WAF 或 CDN 的爬虫白名单设置,而不是反复提交页面。
为了减少返工,核对结果不要只写“已检查”。建议交付一张简表,至少包含:URL、robots.txt 是否放行、meta 是否 noindex、HTTP 状态码、百度蜘蛛日志有无记录、结论、负责人。每一项都写“是/否/未确认”,未确认的不能当作通过。
如果改动前后要做对比,注意搜索需求会随季节、热点和采集时间变化。一次改动后排名波动,不能直接归因于抓取限制解除。更稳妥的做法是:先确认抓取和索引状态恢复正常,再观察一段时间的数据变化。
当 robots.txt 放行、meta 无 noindex、HTTP 返回 200、百度蜘蛛日志有成功记录时,可以认为抓取限制基本排除。若其中任何一项异常,应先修复该项,再谈如何提高百度排名。对于登录后可见、验证码拦截或纯 JS 渲染的页面,上述检查只能定位部分问题,还需要结合权限策略和渲染方案单独处理。
下一步:选一个目标 URL,按上面的五项检查逐条记录,把未通过项交给对应负责人修复,再重新核对一次。