手动实现逻辑回归时预测值维度自动增长触发广播报错
逻辑回归迭代时预测向量维度翻倍问题排查
问题根因
报错的核心原因是权重更新环节的维度不匹配,触发numpy广播机制导致权重形状异常:
- 初始化时权重
self.w被定义为形状(n_features, 1)的二维列向量 - 第一次迭代时,你把预测值
ypred从形状(1000,1)的二维数组flatten成了形状(1000,)的一维数组,后续计算得到的梯度dw形状为(n_features,)(一维数组) - 执行权重更新
self.w = self.w - self.lr * dw时,形状为(n_features,1)的二维数组和形状为(n_features,)的一维数组会触发numpy广播规则,最终更新后的self.w形状变为(n_features, n_features) - 你用
make_blobs生成的数据集默认特征数n_features=2,第二次迭代时np.dot(X, self.w)输出形状为(1000, 2),flatten后长度就是2000,和长度1000的标签y形状不匹配,触发广播报错。
另外你的训练方法形参定义为(self, X, Y),但内部计算代价、打印维度时调用的是全局变量y而非传入的形参Y,属于隐藏的代码隐患,换调用场景很容易出变量引用错误。
修复方案
两种方案任选其一即可,核心是保证权重、梯度、预测值的维度全程对齐:
方案1:使用权重一维数组(实现最简便)
初始化权重时直接使用一维数组,去掉多余的列维度,从根源避免广播异常:
# 替换原初始化代码 self.w=np.zeros((self.n,1)) self.w = np.zeros(self.n) self.b = 0
修改后运算逻辑天然对齐:
np.dot(X, self.w)输出形状直接是(self.m,),和标签y形状完全一致,不需要额外flatten- 计算得到的梯度
dw形状为(self.n,),和权重形状匹配,参数更新不会出现维度异常
方案2:全程保持二维矩阵运算(逻辑更严谨)
如果习惯用列向量形式做矩阵运算,就不要把预测值拍平成一维,同时把标签也转为对应二维形状:
self.w=np.zeros((self.n,1)) self.b=0 #training loop for i in range (self.itr+1): # 预测值保持二维形状 (m,1) ypred = self.sigmoid(np.dot(X, self.w) + self.b) # 标签转为二维列向量,和预测值形状对齐 y_train = Y.reshape(-1, 1) # 计算代价 cost= -(1/self.m)*np.sum(y_train*np.log(ypred)+ (1-y_train)*np.log(1-ypred)) # 计算梯度,dw形状为(n,1),和权重形状完全匹配 dw=(1/self.m)*np.dot(X.T, (ypred-y_train)) db=(1/self.m)*np.sum(ypred-y_train) self.w=self.w-self.lr*dw self.b=self.b-self.lr*db
注意:上述代码已经把训练过程引用的标签从全局变量y改成了形参Y,修复了之前提到的变量引用隐患。
内容的提问来源于stack exchange,提问作者anna
相关产品推荐
相关产品推荐

