You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

针对变长序列的RNN注意力权重是否需重新归一化以屏蔽零填充影响?

关于自注意力的明确说明

先跟大家明确一下:我这里讨论的是《Hierarchical Attention Networks for Document Classification》中描述的自注意力(self-attention),这种注意力机制已经在诸多业务场景中得到了落地实现。

需要特别区分的是:本文所指的自注意力,并非编码器-解码器模型里seq2seq架构使用的Bahdanau注意力(也就是大家常说的seq2seq类型注意力)。不过也得提一句,咱们探讨的相关问题或许同样适用于Bahdanau注意力,只是我对这类注意力机制的了解不算深入,就不展开赘述了。

从本质上来说,自注意力其实是对RNN隐藏状态计算加权平均——它算是mean-pooling(均值池化)的泛化形式:均值池化是完全无加权的平均操作,而自注意力会为不同的RNN隐藏状态分配对应的权重后再进行平均计算。


内容的提问来源于stack exchange,提问作者t-flow

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 04:34:06