如何在robots.txt中禁止多个目录爬取 现有配置是否有效?
关于robots.txt禁止指定目录爬取配置的有效性解答
结论
你当前的配置是正确的,可以实现禁止合规爬虫爬取/staging/、/test/两个目录及其所有子目录、子文件的需求。
规则说明
robots.txt的Disallow字段采用前缀匹配逻辑:
- 你配置的
Disallow: /staging/会匹配所有站点根路径下以/staging/开头的所有路径,刚好覆盖http://example.com/staging/目录本身及下属所有内容 Disallow: /test/同理覆盖你指定的第二个目标目录
注意事项
- 该规则仅对主动遵守robots协议的正规爬虫生效,恶意爬虫会直接忽略robots.txt的约束,这类场景需要额外通过IP封禁、访问权限校验等手段实现防护
- 请确保你的robots.txt文件放置在站点根目录,即可以通过
http://example.com/robots.txt正常访问,否则爬虫无法读取到你配置的规则
内容的提问来源于stack exchange,提问作者clarkf
相关产品推荐
相关产品推荐

