You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

LLM爬虫是否遵守robots元标签?细分权限管控方案探讨

大语言模型爬虫的细粒度robots管控方案

目前通过robots.txt针对特定LLM爬虫(比如GPTBot)设置全站禁止的方式,确实只能由站点管理员操作,无法满足CMS用户按账户/页面维度自定义管控的需求,而robots元标签是实现细粒度管控的可行方案,具体细节如下:

1. 传统noindex元标签的有效性

主流LLM爬虫(如OpenAI的GPTBot、Google的Gemini爬虫)大多会尊重标准的robots元标签规则,将noindex视为禁止抓取收录的标识,也就意味着不会将该页面内容用于模型训练。示例代码:

<meta name="robots" content="noindex">

如果需要针对特定LLM爬虫单独设置,也可以指定爬虫名称,比如只禁止GPTBot抓取该页面:

<meta name="GPTBot" content="noindex">

2. noteach/nolearn等自定义元标签的现状

部分平台推出了noteach、nolearn这类专门针对模型训练的自定义元标签,但这类标签目前没有统一的行业标准,仅被少数LLM服务商支持(比如部分小众模型或特定平台的爬虫)。如果你的需求是覆盖主流LLM爬虫,优先使用标准的noindex元标签会更可靠;如果需要针对特定支持自定义标签的爬虫,可以额外添加这类标签作为补充,示例:

<meta name="robots" content="noindex, noteach">

3. 适合CMS用户的落地方式

对于CMS平台的普通用户,可以通过页面编辑功能,为需要禁止LLM抓取的页面动态插入对应的robots元标签:

  • 若用户希望自己的所有内容都不被LLM抓取,可以在账户级的模板中统一添加元标签;
  • 若仅需针对单篇内容设置,直接在对应页面的HTML头部插入标签即可。

内容的提问来源于stack exchange,提问作者MediaFormat

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.04 09:32:09