怎么创建自己的博客_怎样核对抓取限制

📍 WDQWDWQD987AAAAA:216.73.216.123
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /6d45d76ae1a9.html
📄

怎么创建自己的博客_怎样核对抓取限制

核对抓取限制,就是确认搜索引擎能否正常访问你的博客页面,以及哪些目录被规则挡住。对多人协作的博客项目,最有效的做法是:把 robots.txt、页面 meta 标签、HTTP 响应头三处规则列成一张对照表,逐一检查是否互相矛盾。任何一处禁止抓取,都可能让另外两处的放行失效。

准备:先确认博客的抓取规则分布在哪

一个博客的抓取限制通常来自三个位置,核对前先明确各自的作用范围:

多人协作时,常见返工原因是模板作者加了 meta 限制,运维又在响应头里加了同样的限制,两边都没记录。准备阶段要做的,是让每个人只负责一层,并在交付说明里写清自己改了什么、影响哪些路径。

实施:按顺序核对三层规则

顺序很重要,因为规则是叠加的,不是覆盖的。只要有一层禁止,抓取就会被挡。

  1. 打开浏览器访问 你的域名/robots.txt,确认文件能正常返回。如果返回 404,说明没有站点级限制;如果返回 200,逐行看 Disallow 是否命中博客的文章目录、标签页或分页。
  2. 查看目标页面的源代码,搜索 <meta name="robots">。出现 noindex 表示不收录,出现 nofollow 表示不追踪链接,出现 none 等于两者都禁止。
  3. 用命令行或浏览器开发者工具查看响应头,确认是否存在 X-Robots-Tag。这一步最容易漏,因为它不出现在页面源码里。

最关键的一步是第三步。很多协作团队只检查了前两层就交付,结果响应头里的限制一直生效。检查方法:在终端执行 curl -I 页面地址,看返回头里有没有 X-Robots-Tag。

验证:用可复现的方式确认结果

改完规则后,不要凭印象判断。可以用以下检查项逐条确认:

这里要区分“可能原因”和“已经定位的原因”。如果页面没被抓取,可能是规则拦截,也可能是内链太少、服务器响应慢、内容重复。只有在确认三层规则都放行之后,才能把规则因素排除,继续查其他方向。

维护:把核对结果写进交付文档

多人协作的博客,规则会随模板升级、迁移、改版而变化。建议在项目文档里固定记录三项:当前 robots.txt 的放行范围、页面模板是否输出 meta 限制、服务器配置是否下发 X-Robots-Tag。每次改版后重新跑一遍上面的检查项,并记录改动前后的对比。

比较改动效果时要注意,抓取量变化可能来自季节、内容更新频率或采集差异,不能只凭一次数据断定是规则改动带来的。判断时应看多天趋势,而不是单日数值。

下一步:把这三层规则的检查结果整理成一张表,交给负责发布的人确认,再决定是否需要提交站点地图或调整内链。

图1 图2

nginx