预训练语言模型监督微调:新增输出层是否影响非微调相关词概率?
监督微调额外输出层对无关词汇概率的影响
若仅训练新增的输出层(冻结预训练模型主体参数):
预训练模型的内部参数完全没变化,它输出的基础词汇概率分布不会被改动。新增输出层只是把预训练模型的顶层特征做任务适配性映射,不会反向影响模型对词汇概率的底层计算,所以和微调数据无关的词汇概率完全不受影响。若联合训练新增输出层与预训练模型主体(即不冻结预训练参数):
预训练模型的内部参数会被更新,模型整体的特征空间会因微调数据发生调整。这种情况下,不管词汇是否和微调数据相关,它们的概率分布都会受到不同程度的影响——哪怕是完全无关的词汇,模型内部的注意力、词嵌入等参数的变化,也会改变其概率。
简单总结:核心取决于微调时是否改动预训练模型的主体参数,只动新增层则无关词汇概率不变,动了主体参数则所有词汇概率都可能发生变化。
内容的提问来源于stack exchange,提问作者Chen APD
相关产品推荐
相关产品推荐

