如何借助技术手段阻止合规生成式AI抓取使用我的开源代码?
阻止合规生成式AI使用开源代码的技术手段
以下是针对合规生成式AI爬虫的有效技术限制手段:
配置robots.txt规则:在代码仓库根目录创建
robots.txt文件,针对已知的合规AI爬虫User-Agent设置禁止访问规则。示例内容如下:User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: GeminiBot Disallow: /需注意不同AI服务商的爬虫标识可能会更新,要及时对应调整。
添加仓库显性声明:在仓库的README文件开头或专门的说明文件中,明确标注禁止将代码用于AI训练的内容,例如:
*本仓库代码禁止被用于任何生成式AI模型的训练数据集*,部分合规AI会识别这类显性提示并跳过采集。许可证补充AI限制条款:在开源许可证中补充针对AI训练的限制内容,合规AI通常会读取许可证信息,若条款明确禁止用于AI训练,会遵循该规则。比如在MIT许可证基础上添加:
本代码禁止被用于生成式AI模型的训练、数据采集或相关训练素材构建网页代码添加robots元标签:如果你的代码通过网页形式托管展示,在页面的
<head>区域添加如下元标签,禁止AI爬虫索引内容:<meta name="robots" content="noindex, nofollow" />使用专用排除文件:在仓库根目录创建
.noai或.exclude-from-ai这类无内容的空文件,部分代码托管平台和合规AI爬虫会识别这类文件,自动跳过对该仓库的采集。
内容的提问来源于stack exchange,提问作者foo
相关产品推荐
相关产品推荐

