使用Apache .htaccess阻止AI爬虫机器人
Apache .htaccess阻止AI爬虫机器人
嘿,我太懂你想拦AI爬虫的心情了!我自己也踩过这类爬虫的坑,整理了一套用.htaccess拦截的方案,你可以直接拿去用:
<IfModule mod_rewrite.c> RewriteEngine on RewriteBase / # 拦截各类AI爬虫机器人 RewriteCond %{HTTP_USER_AGENT} (AdsBot-Google|Amazonbot|anthropic-ai|Applebot|Applebot-Extended|AwarioRssBot|AwarioSmartBot|Bytespider|CCBot|ChatGPT|ChatGPT-User|Claude-Web|ClaudeBot|cohere-ai|DataForSeoBot|Diffbot|FacebookBot|facebookexternalhit|Google-Extended|GPTBot|ImagesiftBot|LinkedInBot|PerplexityBot|SemrushBot|TikTokBot|Twitterbot|YandexBot) [NC] RewriteRule ^ - [F,L] </IfModule>
给你唠唠这套规则的逻辑:
- 首先确保
mod_rewrite模块开启(绝大多数Apache服务器默认都支持,要是不行就找主机商帮忙开一下) RewriteCond这行是匹配请求的用户代理(User-Agent),括号里列的都是常见的AI爬虫、商业爬虫标识,[NC]是忽略大小写,避免漏掉那些大小写混乱的UARewriteRule ^ - [F,L]是直接给这些爬虫返回403禁止访问的响应,F代表Forbidden,L表示这是最后一条规则,匹配到就停住不往下走了
之后要是碰到新的AI爬虫,直接把它的UA标识加到括号里,用|和前面的内容隔开就行,超省心!
备注:内容来源于stack exchange,提问作者ppr
相关产品推荐
相关产品推荐

