TensorFlow报错:No gradients provided for any variable原因排查求助
我在TensorFlow中执行了如下损失计算与优化器定义逻辑:
# 计算损失值 cost = tf.reduce_mean(tf.square(y - out)) minimizer = tf.train.GradientDescentOptimizer(learning_rate).minimize(cost)
运行minimizer = tf.train.GradientDescentOptimizer(learning_rate).minimize(cost)时触发了如下错误:
ValueError: No gradients provided for any variable, check your graph for ops that do not support gradients, between variables ["<tf.Variable 'parameters:0' shape=(15,) dtype=float32_ref>", "<tf.Variable 'weights:0' shape=(6,) dtype=float32_ref>"] and loss Tensor("Mean_1:0", dtype=float32)
请问这个计算流程存在什么问题?原因是什么?
这个错误我调试模型时也碰到过,本质是TensorFlow找不到从损失cost到你的可训练变量parameters和weights的梯度传播路径——简单说就是这两个变量和最终的损失值之间,没有建立起能反向传播的可微分连接。
具体可能的原因有这几个:
预测值
out的计算完全没用到这两个变量
先检查out的定义代码:如果计算out的时候根本没引入parameters或weights,那这两个变量和损失完全没关系,自然不会有梯度。比如是不是写代码时漏用了变量,或者不小心用了其他常量代替?计算
out时用了切断梯度流的操作
TensorFlow的自动梯度只支持可微分的操作,如果out的计算链里包含了这类操作,梯度会直接中断:- 不可逆的操作:比如
tf.argmax(取索引是不可逆的)、tf.cast(x, tf.bool)(布尔类型无法计算梯度) - 自定义Python函数:比如用
tf.py_function包裹了普通Python代码,这类操作默认不会记录梯度 - 手动停止梯度:比如不小心用了
tf.stop_gradient(out),直接切断了梯度传播
- 不可逆的操作:比如
计算过程中混用了Numpy和TensorFlow操作
如果在计算out时,把TensorFlow张量转换成了Numpy数组(比如用.numpy()方法),再用Numpy操作计算后转回张量,这条路径的梯度链会直接断裂——因为Numpy操作不在TensorFlow的计算图里,没法记录梯度信息。变量没有被正确用于正向传播
比如虽然你定义了tf.Variable,但在计算out时用的是变量的.numpy()值,而不是张量本身,这样变量也不会参与到计算图的梯度传播中。
快速排查方法
- 先手动计算梯度试试:执行
tf.gradients(cost, [parameters, weights]),如果返回的是[None, None],就实锤了损失和变量之间没有梯度连接。 - 检查
out的依赖:用tf.compat.v1.get_default_graph().get_operation_by_name("out的操作名")(如果给out的计算加了名字)查看它的输入依赖,确认是否包含parameters和weights。 - 把
out的计算代码拆成小步骤,每一步都检查是否能正常计算梯度,逐步定位到切断梯度的环节。
内容的提问来源于stack exchange,提问作者John

