You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在robots.txt中禁止多个目录爬取 现有配置是否有效?

关于robots.txt禁止指定目录爬取配置的有效性解答

结论

你当前的配置是正确的,可以实现禁止合规爬虫爬取/staging/、/test/两个目录及其所有子目录、子文件的需求。

规则说明

robots.txt的Disallow字段采用前缀匹配逻辑:

  • 你配置的Disallow: /staging/会匹配所有站点根路径下以/staging/开头的所有路径,刚好覆盖http://example.com/staging/目录本身及下属所有内容
  • Disallow: /test/同理覆盖你指定的第二个目标目录

注意事项

  • 该规则仅对主动遵守robots协议的正规爬虫生效,恶意爬虫会直接忽略robots.txt的约束,这类场景需要额外通过IP封禁、访问权限校验等手段实现防护
  • 请确保你的robots.txt文件放置在站点根目录,即可以通过http://example.com/robots.txt正常访问,否则爬虫无法读取到你配置的规则

内容的提问来源于stack exchange,提问作者clarkf

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.23 20:15:02