You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

OpenAI GPT-3 API:不同语言的Token计数机制是怎样的?

GPT-3 的 Token 计数与分词机制解析

GPT-3 采用**Byte-Pair Encoding (BPE)**作为核心分词机制,和传统NLP分语言单独处理的逻辑不同,它基于多语联合训练的统一词表,实现了多语言混合输入输出的无缝支持,具体处理方式如下:

1. 英语等字母语言的处理

和Bert的BPE逻辑一致,会将词汇拆分为常见的子词单元,比如:

Insomnia caused much frustration.
==>
In-, som-, nia, caus-, ed, much, frus-, tra-, tion, .

但GPT-3的BPE词表是在海量多语语料上训练的,拆分规则会兼顾不同字母语言的常用子词模式,比单一语言的BPE更通用。

2. 中文、日语等表意语言的处理

和传统NLP直接以单个字符为分词单元的方式不同,GPT-3的BPE会自动识别表意语言中的常用字符组合,将其合并为单个Token,大幅减少Token数量:

  • 日语示例(传统分词 vs GPT-3分词):
    传统分词:
    東京メトロは心に寄り添う
    ==>
    東, 京, メ, ト, ロ, は, 心, に, 寄, り, 添, う
    
    GPT-3分词(示例):
    東京メトロは心に寄り添う
    ==>
    東京, メトロ, は, 心, に, 寄り添う
    
  • 中文示例(传统分词 vs GPT-3分词):
    传统分词:
    我说你倒是快点啊!!!
    ==>
    我, 说, 你, 倒, 是, 快, 点, 啊, !, !, !
    
    GPT-3分词(示例):
    我说你倒是快点啊!!!
    ==>
    我, 说, 你, 倒是, 快点, 啊, !, !, !
    

3. 多语言混合场景的Token处理

GPT-3的统一多语BPE词表包含了各语言的常用子词/字符组合,当输入混合语言内容时,模型会直接对整段文本进行BPE拆分,不需要切换分词逻辑。比如输入“我明天要去Tokyo看sakura”,会被拆分为类似我, 明天, 要, 去, Tokyo, 看, sakura这样的Token,不同语言的单元会被统一编码处理。

内容的提问来源于stack exchange,提问作者dongrixinyu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 19:55:15