SpaCy 3如何获取en_core_web_sm模型训练所用的原始NER标注数据?
关于spaCy en_core_web系列NER标注数据的说明
en_core_web系列模型的NER模块基于OntoNotes 5.0数据集训练,你列出的18个NER标签就是该数据集定义的标准实体类别:
'CARDINAL', 'DATE', 'EVENT', 'FAC', 'GPE', 'LANGUAGE', 'LAW', 'LOC', 'MONEY', 'NORP', 'ORDINAL', 'ORG', 'PERCENT', 'PERSON', 'PRODUCT', 'QUANTITY', 'TIME', 'WORK_OF_ART'
核心问题解答
- 没有公开的、按类别整理的固定词汇映射表:NER模型是基于上下文语义判断实体类别,不存在某个词固定对应某类实体的规则,比如同一个名称既可能是
PERSON(人名),也可能出现在WORK_OF_ART(专辑名)的语境中,因此官方不会也无法提供这类固定词表。 - 对应的原始标注语料
OntoNotes 5.0公开可获取:该数据集包含数十万条标注了对应NER类别的文本样本,你可以自行提取所有标注为WORK_OF_ART等目标类别的样本,补充到你的自定义训练集中。
自定义NER的优化方案
你的需求是复用原有NER类别、新增自定义类别,不需要从零收集全量原有类别的训练数据,更高效的实现路径如下:
- 采用spaCy的增量训练机制:基于已有的预训练
en_core_web模型做微调,仅需要标注自定义类别对应的训练样本,同时加入少量原有类别的标注样本避免灾难性遗忘,训练后的模型就能同时支持原有默认类别和新增的自定义类别。 - 如果需要补充特定原有类别的训练样本,可以直接用已有的
en_core_web模型对大规模无标注文本做预测,筛选出置信度高的对应类别样本,经过少量人工校验后加入训练集即可,标注成本远低于从零制作。
内容的提问来源于stack exchange,提问作者Zizzipupp
相关产品推荐
相关产品推荐

