You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何借助技术手段阻止合规生成式AI抓取使用我的开源代码?

阻止合规生成式AI使用开源代码的技术手段

以下是针对合规生成式AI爬虫的有效技术限制手段:

  • 配置robots.txt规则:在代码仓库根目录创建robots.txt文件,针对已知的合规AI爬虫User-Agent设置禁止访问规则。示例内容如下:

    User-agent: GPTBot
    Disallow: /
    User-agent: ClaudeBot
    Disallow: /
    User-agent: GeminiBot
    Disallow: /
    

    需注意不同AI服务商的爬虫标识可能会更新,要及时对应调整。

  • 添加仓库显性声明:在仓库的README文件开头或专门的说明文件中,明确标注禁止将代码用于AI训练的内容,例如:*本仓库代码禁止被用于任何生成式AI模型的训练数据集*,部分合规AI会识别这类显性提示并跳过采集。

  • 许可证补充AI限制条款:在开源许可证中补充针对AI训练的限制内容,合规AI通常会读取许可证信息,若条款明确禁止用于AI训练,会遵循该规则。比如在MIT许可证基础上添加:本代码禁止被用于生成式AI模型的训练、数据采集或相关训练素材构建

  • 网页代码添加robots元标签:如果你的代码通过网页形式托管展示,在页面的<head>区域添加如下元标签,禁止AI爬虫索引内容:

    <meta name="robots" content="noindex, nofollow" />
    
  • 使用专用排除文件:在仓库根目录创建.noai或.exclude-from-ai这类无内容的空文件,部分代码托管平台和合规AI爬虫会识别这类文件,自动跳过对该仓库的采集。

内容的提问来源于stack exchange,提问作者foo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 04:00:08