You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

请求解释论文《On the difficulty of training Recurrent Neural Networks》中的即时偏导数∂⁺xₖ/∂θ

请求解释论文《On the difficulty of training Recurrent Neural Networks》中的即时偏导数∂⁺xₖ/∂θ

哈喽,我来给你掰扯清楚这个「即时偏导数」到底啥意思~

首先先回顾下论文里的RNN状态更新公式:
$$
x_t=F(x_{t-1},u_t,\theta) \
x_t=W_{rec}\sigma(x_{t-1})+W_{in}u_t+b
$$
这里的$\theta$就是所有可训练参数的集合:$\theta = {W_{rec}, W_{in}, b}$。你提到的误差对参数的导数公式是:
$$
\frac{\partial\varepsilon_t}{\partial\theta}=\sum\left(\frac{\partial\varepsilon_t}{\partial x_t}\frac{\partial x_t}{\partial x_k}\frac{\partial^{+}x_k}{\partial\theta}\right)
$$

重点说$\frac{\partial^{+}x_k}{\partial\theta}$——论文里说这是「状态$x_k$对$\theta$的即时偏导数」,核心就是:计算的时候把$x_{k-1}$当成完全固定的常量,完全忽略它对$\theta$的递归依赖,只算$\theta$在当前步骤直接影响$x_k$的那部分导数。

给你举几个具体的例子,对应$\theta$里的不同参数:

  • 针对循环权重$W_{rec}$的即时偏导数:
    看$x_k$的表达式,$W_{rec}$直接乘了$\sigma(x_{k-1})$,当我们把$\sigma(x_{k-1})$当成固定值时,$\frac{\partial^{+}x_k}{\partial W_{rec}}$就是$\sigma(x_{k-1})$(如果是向量/矩阵形式,就是$\sigma(x_{k-1})$的外积,核心逻辑就是只取当前步骤的直接项)。

  • 针对输入权重$W_{in}$的即时偏导数:
    $W_{in}$直接乘了输入$u_k$,输入是外部给定的,本身不依赖$\theta$,把它当成固定值后,$\frac{\partial^{+}x_k}{\partial W_{in}}$就是$u_k$。

  • 针对偏置$b$的即时偏导数:
    $b$是直接加到$x_k$里的常数项,所以即时偏导数就是全1的向量(标量情况就是1)——因为$b$每增加1,$x_k$的每个维度就直接增加1。

这里要和「非即时的递归导数」区分开:比如如果我们算$\frac{\partial x_k}{\partial W_{rec}}$,那就要考虑$x_{k-1}$本身也依赖$W_{rec}$(毕竟$x_{k-1}=W_{rec}\sigma(x_{k-2})+...$),所以这个导数会包含递归的链式项,而即时导数就是把这部分递归依赖完全砍掉,只算当前步骤的直接贡献。

论文里的原话也印证了这一点:

refers to the “immediate” partial derivative of the state xk with respect to θ

说白了就是“只看当前步骤θ直接作用在$x_k$上的部分,别管之前的状态是怎么依赖θ的”。

备注:内容来源于stack exchange,提问作者greedsin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.17 08:00:30