改版或迁移时,百度蜘蛛抓取相关的核对重点不是“提交新链接”,而是确认旧地址如何响应、新地址是否可被抓取、以及抓取预算是否被浪费在无效跳转上。核心判断依据是服务器访问日志、HTTP 状态码和 robots.txt 的实际作用范围,而不是后台提交记录。
很多人把迁移理解为“上线新站、提交新 sitemap、等百度来抓”。这个理解只覆盖了发现环节,却漏掉了抓取环节。百度蜘蛛可能仍然按旧链接抓取,如果旧链接返回 200 且内容已换,蜘蛛会把旧 URL 当作有效页面继续抓;如果旧链接返回 302 或 301 链路过长,抓取会消耗在跳转上。站点地图只是发现线索,不保证收录,也不决定旧地址的响应方式。
改版或迁移后,逐类抽查旧 URL,确认返回的是 301 还是 302、是否一跳到位。判断方式:用 curl -I 查看响应头,或直接看服务器访问日志中百度蜘蛛 UA 对应的状态码。适用条件是旧页面已有新对应页。如果旧页面没有新对应页,应返回 410 或 404,而不是 301 到首页,后者会被当作软 404 处理,浪费抓取。跳转链超过两跳时,应改为直接 301 到最终地址。
robots.txt 的抓取限制不等于可靠的索引移除。改版时常见错误是把旧目录整段 Disallow,却忘了新目录也落在该规则下。核对方法:打开 /robots.txt,逐条比对 Disallow 路径与新站实际目录,确认没有把新 URL 规则误伤。同时注意,Disallow 只阻止抓取,不阻止已收录 URL 出现在结果中;如果目标是移除旧内容,应配合 301 或 410,而不是只改 robots.txt。
站内链接、导航、面包屑和 sitemap 应全部指向跳转后的最终 URL,而不是经过 301 的旧地址。检查项:随机抽取 20 个内链,确认其 href 不是旧路径;查看 sitemap 中的 URL 是否与最终可达地址一致。适用条件是新站结构已稳定。如果内链仍大量指向旧地址,百度蜘蛛会持续抓取旧 URL,再通过跳转到达新页,抓取效率下降。判断结果:日志中旧 URL 的抓取频次应逐步下降,新 URL 应逐步上升。
HTTPS 不保证安全无漏洞或排名,但迁移时协议和主机名不统一会制造重复抓取。核对方法:分别用 http、https、带 www 和不带 www 访问同一页面,确认只有一种组合返回 200,其余全部 301 到该组合。适用条件是站点已确定唯一主域名。如果四种组合都能返回 200,百度蜘蛛可能把它们当作不同 URL 分别抓取,稀释新站抓取量。
下一步:在完成上述核对后,保持日志观察至少一个抓取周期,对比旧 URL 与新 URL 的抓取次数变化,再决定是否需要调整内链或跳转策略。