You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

statsmodels OLS与scikit-learn线性回归在鸢尾花数据集上的结果差异问题

差异原因

核心原因是你触发了虚拟变量陷阱,导致设计矩阵存在完全多重共线性,此时线性回归的参数解不唯一,两个库的底层求解逻辑差异导致了截距和哑变量系数的不同,连续特征不受共线性影响因此系数完全一致。

具体说明

  • 完全共线的来源:你生成了3个鸢尾花类别的独热编码列,三个列的逐行和恒等于1,和线性回归的截距项(statsmodels手动加的const、sklearn默认拟合的intercept)完全线性相关,此时设计矩阵秩亏缺,OLS存在无穷多组等价的参数解,所有解的预测效果完全相同,仅共线项的参数分配有差异。
  • 两个库的处理差异:
    • statsmodels的OLS默认使用伪逆直接求解亏秩矩阵的最小二乘解,会返回其中一组可行的参数组合。
    • scikit-learn的LinearRegression在默认开启fit_intercept=True时,会先对输入特征做中心化处理再求解,数值计算路径和statsmodels不同,因此返回了另一组等价的可行参数组合。

解决方法

要让两个库输出完全一致的结果,只需要消除完全共线性即可,可选两种方案:

  1. 生成独热编码时增加drop_first=True参数,丢掉1个哑变量列,仅保留k-1个哑变量消除共线性,再拟合时两个库的结果会完全匹配。
  2. 保留全量哑变量的前提下,关闭截距拟合:statsmodels不手动加const列,sklearn初始化时设置LinearRegression(fit_intercept=False),两者结果也会一致。

内容的提问来源于stack exchange,提问作者HANBYEOL LEE

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 04:54:10