如何配置robots.txt仅禁止爬虫抓取首页,允许抓取其他页面?
如何阻止Google爬虫抓取首页但允许其他页面?
你之前的配置无效,问题出在重复定义了User-agent: *,后面的空Disallow:规则会覆盖前面的禁止设置,最终等于允许所有页面被抓取。
要实现只禁止根路径首页、允许其他页面的需求,你需要用**结尾匹配符$**来精准定位首页,正确的robots.txt配置如下:
# 仅禁止Google爬虫抓取根路径首页 User-agent: Googlebot Disallow: /$ # 允许其他所有爬虫抓取所有页面(可选,默认规则就是允许) User-agent: * Allow: /
规则说明:
/$是robots.txt的特殊匹配符,代表匹配路径的结尾,只会命中https://你的域名/这个首页地址;- 其他路径比如
https://你的域名/about、https://你的域名/article/123等都不会被这个规则限制; - 如果只需要针对Google爬虫做限制,
User-agent: *的配置块可以省略,因为默认情况下未被明确禁止的页面都会被允许抓取。
内容的提问来源于stack exchange,提问作者victor.ja
相关产品推荐
相关产品推荐

