使用Doc2Vec向量化文本时适配的有效文本增强技术有哪些?
适配已训练Doc2Vec的文本增强方案
核心筛选原则
所有增强方法需要同时满足两个要求:
- 不改变原文本的下游任务标签(比如你的情感分类场景里,正样本增强后依然是正情感)
- 能让已训练的Doc2Vec输出和原样本有合理差异的向量,避免增强样本无效
推荐适用的增强方法
- 同义词/近义词替换:和你的直觉一致,是这类场景下效果最好的方法。比如你例子里的
happy替换为ecstatic,核心情感标签不变,同时Doc2Vec不管采用PV-DM还是PV-DBOW模式,都会识别到词汇变化,输出的向量会存在合理差异,正好给下游分类器提供更丰富的特征,平滑决策边界。实操时可以用同义词词库(如WordNet)或小样本微调后的掩码语言模型做替换,避免出现语义偏移。 - 非核心词删除:删除原句中不影响核心语义的虚词、冗余修饰词,比如你的例子可以删去定冠词得到
dog is happy,语义标签不变,输入Doc2Vec后会因为输入序列变化产生有差异的向量。注意不要删除和分类标签相关的核心词(如例子里的happy)。 - 无关属性插入:在原句中加入不影响核心语义的修饰属性,比如你的例子可以扩展为
the cute dog is happy,核心语义依然是正向情感,新增的词汇会让Doc2Vec输出的向量产生合理变化。 - 词形/时态变换:针对英文场景,可以在不改变语义的前提下修改词汇时态、单复数等形式,比如把例子改为
the dog was happy,标签不变,Doc2Vec输出的向量也会产生可用于增强的差异。
不建议使用的方法
- 语序调换:正如你提到的,Doc2Vec对词序敏感度极低,尤其是PV-DBOW模式本身就是忽略词序建模的,调换语序后得到的向量和原样本几乎完全一致,完全起不到增强效果。
- 随机字符增删/错拼:这类操作生成的异常词汇如果没有出现在Doc2Vec的训练词表中,会被当做未知词处理,输出的向量要么完全随机,要么和原词差异过大,很容易导致语义偏移、标签错误。
- 回译:这类方法生成的文本要么和原句用词高度重合,向量差异极小,要么容易改变核心语义,性价比极低。
实操建议
你当前的流水线为 text -> d2v -> binary classifier,增强后可以先抽样对比原样本和增强样本的Doc2Vec向量余弦相似度,控制在0.7-0.9区间效果最好:相似度过高等于无效果增强,相似度过低说明语义偏移严重,可能出现标签错误。
内容的提问来源于stack exchange,提问作者dendog
相关产品推荐
相关产品推荐

