You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

求ReLU+稀疏Softmax交叉熵的损失函数与反向传播数学推导及来源

适配场景的损失函数与反向传播公式
  • Sparse Categorical Crossentropy损失(二分类):
    单样本损失:$L = -\log\left(\frac{e{z_{\hat{y}}}}{e{z_0} + e^{z_1}}\right)$,其中$\hat{y} \in {0,1}$是真实标签,$z_0,z_1$为输出层未经过softmax的logit值。
  • 反向传播关键梯度:
    1. 输出层logit的梯度:$\frac{\partial L}{\partial z_k} = \sigma(z_k) - \mathbb{I}(k = \hat{y})$,$\sigma(z_k)$是第k类的softmax输出,$\mathbb{I}$为指示函数(满足条件取1,否则0)。
    2. 隐藏层ReLU的梯度:$\frac{\partial L}{\partial h_i} = \left(\frac{\partial L}{\partial z} \cdot W_{i,:}\right) \cdot \mathbb{I}(h_i > 0)$,$h_i$是隐藏层第i个神经元的ReLU输出,$W_{i,:}$是隐藏层到输出层的权重行向量。

参考资料:《Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow》(第二版)

内容的提问来源于stack exchange,提问作者Rudra

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.12 13:33:13