You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何配置robots.txt仅禁止爬虫抓取首页,允许抓取其他页面?

如何阻止Google爬虫抓取首页但允许其他页面?

你之前的配置无效,问题出在重复定义了User-agent: *,后面的空Disallow:规则会覆盖前面的禁止设置,最终等于允许所有页面被抓取。

要实现只禁止根路径首页、允许其他页面的需求,你需要用**结尾匹配符$**来精准定位首页,正确的robots.txt配置如下:

# 仅禁止Google爬虫抓取根路径首页
User-agent: Googlebot
Disallow: /$

# 允许其他所有爬虫抓取所有页面(可选,默认规则就是允许)
User-agent: *
Allow: /

规则说明:

  • /$是robots.txt的特殊匹配符,代表匹配路径的结尾,只会命中https://你的域名/这个首页地址;
  • 其他路径比如https://你的域名/about、https://你的域名/article/123等都不会被这个规则限制;
  • 如果只需要针对Google爬虫做限制,User-agent: *的配置块可以省略,因为默认情况下未被明确禁止的页面都会被允许抓取。

内容的提问来源于stack exchange,提问作者victor.ja

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.01 14:37:02