针对变长序列的RNN注意力权重是否需重新归一化以屏蔽零填充影响?
关于自注意力的明确说明
先跟大家明确一下:我这里讨论的是《Hierarchical Attention Networks for Document Classification》中描述的自注意力(self-attention),这种注意力机制已经在诸多业务场景中得到了落地实现。
需要特别区分的是:本文所指的自注意力,并非编码器-解码器模型里seq2seq架构使用的Bahdanau注意力(也就是大家常说的seq2seq类型注意力)。不过也得提一句,咱们探讨的相关问题或许同样适用于Bahdanau注意力,只是我对这类注意力机制的了解不算深入,就不展开赘述了。
从本质上来说,自注意力其实是对RNN隐藏状态计算加权平均——它算是mean-pooling(均值池化)的泛化形式:均值池化是完全无加权的平均操作,而自注意力会为不同的RNN隐藏状态分配对应的权重后再进行平均计算。
内容的提问来源于stack exchange,提问作者t-flow
相关产品推荐
相关产品推荐

