You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

非可训练层是否参与其他层反向传播?是否影响梯度下降?

问题解答

核心结论

第二层(my_pca_2)会参与第一层(dense_2)的梯度计算,但它自身的参数不会被更新;非可训练层不会阻碍其他可训练层的梯度下降过程,只会冻结自身参数。

具体解释

  1. 梯度计算依赖完整的反向传播路径:
    反向传播是从损失函数逐层往回推导梯度的过程,不管层是否可训练,反向传播都会经过它。第一层的输出是第二层的输入,损失对第一层参数的梯度必须通过第二层的前向输出结果,以及反向传递过来的梯度来计算,所以第二层的运算完全参与了第一层的梯度推导。

  2. 非可训练层的本质是冻结参数:
    当层被设为非可训练时,只是告诉框架不要计算和更新该层的参数梯度,但反向传播的梯度信号会正常穿过这一层,继续传递到前面的可训练层。比如你的模型中,my_pca_2的2570个参数不会在训练中改变,但损失对dense_2输出的梯度会通过my_pca_2正常传递,从而让dense_2的200960个可训练参数正常进行梯度下降更新。

  3. 对训练过程的影响:
    非可训练层相当于一个固定的“数据转换模块”,它的输出会影响后续的损失计算,进而间接影响前面可训练层的梯度方向,但不会中断梯度传递,也不会阻止前面的层更新参数。

内容的提问来源于stack exchange,提问作者David H. J.

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 22:25:42