预训练word2vec模型学习新词所需的上下文样本量约为多少
word2vec 适配新词及语义演化追踪的说明
原生静态word2vec模型训练完成后词表固定,无内置的增量语义更新能力,无法直接用于自动追踪新词及语义演化。如果需要实现相关需求,需要搭配额外的工程流程:
- 可以按时间维度对语料分片,训练多个对应时段的word2vec模型,再做跨时段的向量空间对齐,通过对比同一词汇在不同时段的向量余弦相似度变化,捕捉其语义用法的演化
- 也可以定期收集包含新词的新语料,通过增量训练的方式更新原有模型,覆盖新出现的词汇及用法
预训练word2vec增量学习新词的参考样本量
该数值没有绝对标准,受新词的义项复杂度、语料领域匹配度、向量精度要求影响,行业通用的参考范围如下:
- 如果仅需要获得该词的基础语义表示:需要该新词在不同上下文场景中出现 50~200次,且上下文需覆盖该词的常见搭配场景,无明显语料偏差即可
- 如果需要对齐原有预训练模型的向量分布,或者捕捉该词的多个义项:需要至少 300次以上 的有效上下文出现记录,增量训练时建议固定原有模型的权重仅更新新词向量,避免破坏原有词表的向量分布
- 针对小众领域新词、语义高度依赖特定语境的特殊词汇:需要的样本量会提升至1000次以上,才能获得稳定可复用的向量表示
小提示:增量训练时建议保持和原预训练模型一致的上下文窗口大小(通常为510),训练迭代轮次控制在35轮即可,避免新词向量过拟合。
内容的提问来源于stack exchange,提问作者gunnit
相关产品推荐
相关产品推荐

