You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

robots.txt配置异常排查:屏蔽特定User-agent却拦截Google Bot

问题:robots.txt配置导致Google Bot被拦截的原因分析

需求为屏蔽Wayback Machine爬虫(ia_archiver),允许其他所有User-agent访问。配置的robots.txt如下:

User-agent: *

Sitemap: https://www.example.com/sitemap.xml


User-agent: ia_archiver
Disallow: /

半年后发现网站访问量骤降,且Google Bot停止抓取索引,经robots.txt验证工具确认,Disallow: /规则被Google Bot识别,导致其被拦截。请问该robots.txt配置存在什么问题?是否是条目顺序导致的?

回答

  • 这个配置的核心问题不是条目顺序,而是对User-agent: *的规则设置遗漏了关键的Allow指令。
  • 按照robots.txt的规范,当你指定User-agent: *但未配置任何Allow或Disallow规则时,Google Bot会默认将其解读为「未明确允许访问」。后续遇到针对特定爬虫的Disallow: /规则时,它会结合全局规则的缺失,错误触发拦截逻辑。
  • 正确的配置应该给User-agent: *加上Allow: /,明确允许所有爬虫访问,再单独针对ia_archiver设置禁止规则。修正后的代码如下:
User-agent: *
Allow: /
Sitemap: https://www.example.com/sitemap.xml

User-agent: ia_archiver
Disallow: /
  • 简言之,原配置只声明了全局爬虫范围,却未明确赋予访问权限,Google Bot因此误判自己属于被禁止的范围。无论调整条目顺序,只要User-agent: *缺少Allow: /,问题都会存在。

内容的提问来源于stack exchange,提问作者Avatar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 01:07:04