关于Word2Vec Hierarchical Softmax内部顶点存储向量的技术疑问
Hierarchical Softmax内部顶点向量的说明
内部顶点的向量就是维度等于词嵌入尺寸的可训练参数,和词嵌入向量的初始化、更新逻辑完全一致:
- 初始化:通常是小范围随机值初始化(比如服从正态分布或均匀分布),维度必须和输入词嵌入一致,才能完成点积运算。
- 训练更新:和词嵌入向量一同通过反向传播迭代调整——每次计算路径上的分类损失后,梯度会传导到这些内部顶点向量上,逐步优化其数值,直到训练结束。
额外说明:这些内部顶点向量没有对应真实语义,只是模型为完成层级分类任务学习到的中间参数,作用是在每一层决策时,给输入词嵌入提供分类判断的依据。
内容的提问来源于stack exchange,提问作者myfakeaccount
相关产品推荐
相关产品推荐

