求ReLU+稀疏Softmax交叉熵的损失函数与反向传播数学推导及来源
适配场景的损失函数与反向传播公式
- Sparse Categorical Crossentropy损失(二分类):
单样本损失:$L = -\log\left(\frac{e{z_{\hat{y}}}}{e{z_0} + e^{z_1}}\right)$,其中$\hat{y} \in {0,1}$是真实标签,$z_0,z_1$为输出层未经过softmax的logit值。 - 反向传播关键梯度:
- 输出层logit的梯度:$\frac{\partial L}{\partial z_k} = \sigma(z_k) - \mathbb{I}(k = \hat{y})$,$\sigma(z_k)$是第k类的softmax输出,$\mathbb{I}$为指示函数(满足条件取1,否则0)。
- 隐藏层ReLU的梯度:$\frac{\partial L}{\partial h_i} = \left(\frac{\partial L}{\partial z} \cdot W_{i,:}\right) \cdot \mathbb{I}(h_i > 0)$,$h_i$是隐藏层第i个神经元的ReLU输出,$W_{i,:}$是隐藏层到输出层的权重行向量。
参考资料:《Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow》(第二版)
内容的提问来源于stack exchange,提问作者Rudra
相关产品推荐
相关产品推荐

