核对抓取限制,就是确认搜索引擎能否正常访问你的博客页面,以及哪些目录被规则挡住。对多人协作的博客项目,最有效的做法是:把 robots.txt、页面 meta 标签、HTTP 响应头三处规则列成一张对照表,逐一检查是否互相矛盾。任何一处禁止抓取,都可能让另外两处的放行失效。
一个博客的抓取限制通常来自三个位置,核对前先明确各自的作用范围:
robots.txt:放在站点根目录,对整站或指定路径生效,属于站点级规则。<meta name="robots">:写在单个页面的 <head> 里,只影响该页。X-Robots-Tag:由服务器返回,可作用于非 HTML 文件,也可按路径批量下发。多人协作时,常见返工原因是模板作者加了 meta 限制,运维又在响应头里加了同样的限制,两边都没记录。准备阶段要做的,是让每个人只负责一层,并在交付说明里写清自己改了什么、影响哪些路径。
顺序很重要,因为规则是叠加的,不是覆盖的。只要有一层禁止,抓取就会被挡。
你的域名/robots.txt,确认文件能正常返回。如果返回 404,说明没有站点级限制;如果返回 200,逐行看 Disallow 是否命中博客的文章目录、标签页或分页。<meta name="robots">。出现 noindex 表示不收录,出现 nofollow 表示不追踪链接,出现 none 等于两者都禁止。X-Robots-Tag。这一步最容易漏,因为它不出现在页面源码里。最关键的一步是第三步。很多协作团队只检查了前两层就交付,结果响应头里的限制一直生效。检查方法:在终端执行 curl -I 页面地址,看返回头里有没有 X-Robots-Tag。
改完规则后,不要凭印象判断。可以用以下检查项逐条确认:
robots.txt 是否返回 200,内容是否为纯文本,路径拼写是否与实际目录一致。noindex、none 这类禁止值。这里要区分“可能原因”和“已经定位的原因”。如果页面没被抓取,可能是规则拦截,也可能是内链太少、服务器响应慢、内容重复。只有在确认三层规则都放行之后,才能把规则因素排除,继续查其他方向。
多人协作的博客,规则会随模板升级、迁移、改版而变化。建议在项目文档里固定记录三项:当前 robots.txt 的放行范围、页面模板是否输出 meta 限制、服务器配置是否下发 X-Robots-Tag。每次改版后重新跑一遍上面的检查项,并记录改动前后的对比。
比较改动效果时要注意,抓取量变化可能来自季节、内容更新频率或采集差异,不能只凭一次数据断定是规则改动带来的。判断时应看多天趋势,而不是单日数值。
下一步:把这三层规则的检查结果整理成一张表,交给负责发布的人确认,再决定是否需要提交站点地图或调整内链。