You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

NLP中Corpus、Vocabulary、Document的概念区别及实例解析

NLP中Document、Corpus、Vocabulary的概念区分(结合实例说明)

1. Document(文档)

定义:NLP任务中独立的单个文本样本单元,粒度没有统一标准,根据任务需求可以是一句话、一段评论、一篇文章、一整本书,只要是作为单条处理对象的文本,就算一个Document。
对应实例:你给出的DataFrame里每一行的单独文本就是一个Document,本案例中共5个Document:

  • This is Foo, how can I help you
  • It might rain today
  • I love football
  • Crazy, Stupid & Love
  • I shot the sheriff

2. Corpus(语料库)

定义:当前NLP任务所使用的全部Document的完整集合,是做语言规律统计、模型训练的全量文本数据源。Corpus是和具体任务绑定的,数据集更新后Corpus的范围也会同步变化。
对应实例:上述5条Document共同组成的完整文本集合,就是本次任务对应的Corpus。

注意:Corpus保留所有原始文本内容,即使两条Document内容完全重复,也会同时存在于Corpus中。

3. Vocabulary(词表/词汇表)

定义:按照任务预设的文本预处理规则(统一大小写、去标点、特殊字符转义、分词等),对Corpus中所有Document处理后,提取得到的去重独立词元(token)集合,是将文本转换为模型可识别的数字特征时的映射基准。
对应实例:如果采用最基础的预处理规则:统一转小写、去除标点、将转义字符&替换为and、按空格分词,最终得到的Vocabulary包含以下不重复词元:
this, is, foo, how, can, i, help, you, it, might, rain, today, love, football, crazy, stupid, and, shot, the, sheriff

注意:Vocabulary的内容完全由预处理规则决定,如果不做大小写统一,This和this会被判定为两个不同词元同时存入词表;如果将标点也作为独立语义单元,逗号、&等符号也会进入词表。


三者核心区别
  • 层级关系不同:三者是从粗到细的派生关系:多个Document组成Corpus,从Corpus全量文本中经预处理、去重得到Vocabulary
  • 内容规则不同:Corpus保留所有原始样本,允许内容重复;Vocabulary是去重后的词元集合,不存在重复项
  • 用途不同:Document是单条处理的基本单位;Corpus是统计语言特征、训练模型的全量数据源;Vocabulary是文本转数值特征的索引基准,决定了模型能识别的语义单元范围。

内容的提问来源于stack exchange,提问作者Lijin Durairaj

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.02 06:46:04