词性标注:已知词与未知词的区别及论文评估指标咨询
词性标注评估指标拆解:已知词/未知词与各准确率的含义
我来帮你把这些指标的逻辑理清楚,搞懂表1的结果就轻松多了:
核心概念区分:已知词(KW)vs 未知词(UW)
- 已知词(Known Words, KW):就是训练数据集里出现过的词。模型在训练阶段已经学习过这些词的上下文搭配、词性标注模式,对它们的预测是基于已有的经验。
- 未知词(Unknown Words, UW):指测试/验证数据集中,从未在训练集里出现过的词。模型完全没见过这些词,只能靠训练时学到的通用规则(比如词缀特征、拼写规律、上下文语义)来推测词性,这部分最能体现模型的泛化能力。
各准确率指标的定义与计算方式
- 整体准确率:模型在整个测试集上的标注正确率,计算方式是:
(标注正确的总词数 ÷ 测试集总词数) × 100%
它包含了已知词和未知词的所有样本,反映模型的综合表现。 - 已知词准确率:只聚焦测试集中的已知词样本,计算方式是:
(测试集中标注正确的已知词数 ÷ 测试集中已知词总数) × 100%
用来衡量模型对“见过的词”的拟合效果,体现训练的充分性。 - 未知词准确率:对应未知词的标注正确率,计算方式是:
(测试集中标注正确的未知词数 ÷ 测试集中未知词总数) × 100%
这是评估模型泛化能力的关键,看模型能不能处理完全陌生的词汇。
未知词占比(% unk.)
这个指标是测试集中未知词的数量占测试集总词数的比例,计算方式:(测试集未知词总数 ÷ 测试集总词数) × 100%
注意:它的统计范围是测试集(训练集里不存在“未知词”,因为未知词的定义就是没在训练集出现过的)。这个比例越高,说明测试集的挑战性越强——模型需要处理更多陌生词,整体准确率可能会受影响。
内容的提问来源于stack exchange,提问作者AziZ
相关产品推荐
相关产品推荐

