You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

SpaCy 3如何获取en_core_web_sm模型训练所用的原始NER标注数据?

关于spaCy en_core_web系列NER标注数据的说明

en_core_web系列模型的NER模块基于OntoNotes 5.0数据集训练,你列出的18个NER标签就是该数据集定义的标准实体类别:

'CARDINAL', 
'DATE', 
'EVENT', 
'FAC', 
'GPE', 
'LANGUAGE', 
'LAW', 
'LOC', 
'MONEY', 
'NORP', 
'ORDINAL', 
'ORG', 
'PERCENT', 
'PERSON', 
'PRODUCT', 
'QUANTITY', 
'TIME',
'WORK_OF_ART'

核心问题解答

  • 没有公开的、按类别整理的固定词汇映射表:NER模型是基于上下文语义判断实体类别,不存在某个词固定对应某类实体的规则,比如同一个名称既可能是PERSON(人名),也可能出现在WORK_OF_ART(专辑名)的语境中,因此官方不会也无法提供这类固定词表。
  • 对应的原始标注语料OntoNotes 5.0公开可获取:该数据集包含数十万条标注了对应NER类别的文本样本,你可以自行提取所有标注为WORK_OF_ART等目标类别的样本,补充到你的自定义训练集中。

自定义NER的优化方案

你的需求是复用原有NER类别、新增自定义类别,不需要从零收集全量原有类别的训练数据,更高效的实现路径如下:

  • 采用spaCy的增量训练机制:基于已有的预训练en_core_web模型做微调,仅需要标注自定义类别对应的训练样本,同时加入少量原有类别的标注样本避免灾难性遗忘,训练后的模型就能同时支持原有默认类别和新增的自定义类别。
  • 如果需要补充特定原有类别的训练样本,可以直接用已有的en_core_web模型对大规模无标注文本做预测,筛选出置信度高的对应类别样本,经过少量人工校验后加入训练集即可,标注成本远低于从零制作。

内容的提问来源于stack exchange,提问作者Zizzipupp

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 19:39:01