如何配置robots.txt屏蔽-shp结尾URL且不影响正常产品页抓取
针对末尾带
-shp路径的robots.txt配置方案 直接使用通配符+结尾匹配符做精准拦截即可,配置如下:
User-agent: * Disallow: /*-shp$
规则说明
- 该规则对所有主流搜索引擎爬虫生效,不需要额外添加针对正常产品页的Allow规则——robots.txt默认逻辑是:未被Disallow命中的路径全部允许抓取,不会干扰正常页面收录。
- 规则里的符号作用:
*:通配符,匹配任意长度的任意字符,覆盖所有路径前缀的场景$:路径结尾匹配符,限定只有最后以-shp收尾的URL才会被拦截,从根本上避免误杀正常页面
匹配效果验证
- 命中拦截的URL(禁止抓取):
/product/liver-health-formula-shp/product/blood-sugar-formula-shp- 其他任意路径下,末尾带
-shp的地址
- 正常放行的URL(允许抓取):
/product/liver-health-formula/product/blood-sugar-formula- 路径中间包含
-shp但结尾不是该字段的地址,不会被误拦截
注:上述通配符语法是谷歌、必应、百度等主流搜索引擎均支持的标准robots语法,无兼容性问题。
内容的提问来源于stack exchange,提问作者Kristijonas
相关产品推荐
相关产品推荐

