You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于多变量回归R²低于分回归R²之和及系数显著性的技术问询

回归模型R²相关疑问的通俗解答

嘿,这两个问题其实都绕不开回归分析里的一个核心坑——多重共线性,我来给你掰扯清楚:

问题1:为何包含更多变量的回归模型,其R²值低于两个独立回归模型的R²值之和?

首先得回忆下R²的本质:它是模型能解释的因变量变异占总变异的比例,公式是 R² = 1 - SSE/SST,其中SST是总平方和(固定不变,只看因变量本身的变异),SSE是残差平方和。

当你把两个变量放到同一个模型里,它们的解释力不是简单相加的——如果这两个变量高度相关(也就是多重共线性),它们其实在很大程度上是在解释因变量的同一部分变异。举个生活化的例子:

  • 假设你要解释学生的考试成绩,X1是每天学习时长,X2是每周上补习班的时长——这俩变量高度相关,学习时间长的学生大概率也会上更多补习班。
  • 单独用X1能解释成绩变异的30%(R²=0.3),单独用X2也能解释30%(R²=0.3),但把它们放一起,它们的解释力大部分重叠了,合起来可能只能解释35%的变异,远小于0.6。

简单说:独立模型的R²之和,把两个变量重叠的解释力算了两次,但合并后的模型只会算一次,所以自然会出现合并模型R²低于独立模型R²之和的情况。

问题2:三个模型的R²之和大于三变量模型的R²,是因为有统计不显著的系数?

这个情况的核心还是变量间的共线性导致解释力重叠,统计不显著的系数只是可能的表现之一,不是唯一原因:

  1. 先明确逻辑:你提到的两个小模型的R²之和,是「单个变量的解释力」加上「另外两个变量一起的解释力」,这俩部分本身就有重叠——比如那个单个变量和另外两个变量高度相关,第二个小模型的R²里已经包含了一部分单个变量能解释的变异,所以加起来自然会超过三个变量一起的总解释力。

  2. 关于统计不显著的系数:如果三变量模型里额外加的那个系数统计不显著,说明它对模型的解释力贡献极小(甚至没有),那三变量模型的R²可能只比两变量模型的R²高一点点,这时候两个小模型的R²之和就会明显大于三变量的。但这不是必须的:

    • 哪怕第三个变量的系数是显著的,只要它和前两个变量有较强的共线性,它能带来的额外解释力(也就是三变量模型比两变量模型多出来的R²)就会很小,那两个小模型的R²之和还是会超过三变量的。

举个例子:假设Y是店铺销售额,X1是线下广告投入,X2是门店客流量,X3是线上广告点击量——X1和X3高度相关(投线下广告会带动线上点击)。单独X1的R²是0.4,X2+X3的R²是0.5,加起来是0.9;但X1+X2+X3的R²可能只有0.6,因为X1和X3的解释力大部分重叠了,哪怕X3的系数是显著的,它带来的额外解释力也有限。


内容的提问来源于stack exchange,提问作者L. Oleson

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 07:55:18