You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Statsmodels中OLS公式编写:未知列名的ANOVA建模问题

直接用原数据框运行ANOVA的正确写法

没问题,你想要的写法完全可行,核心是要利用Statsmodels公式API的字符串公式语法,而不是直接传入Series对象。咱们来调整你的代码:

改进后的代码

import statsmodels.formula.api as smf
import statsmodels.api as sm

for cat_feature in df.columns:
    # 直接用列名字符串构建公式,不需要新建数据框
    model = smf.ols(f'imp ~ {cat_feature}', data=df).fit()
    res = sm.stats.anova_lm(model, typ=1)
    # 这里可以加上打印或保存结果的代码,比如:
    print(f"ANOVA结果 - 特征: {cat_feature}")
    print(res)
    print("-"*50)

为什么原来的写法不行?

你之前尝试的smf.ols(df['imp'] ~ df[cat_feature], data=df)是错误的,因为Statsmodels的公式接口要求公式是一个字符串,它会根据你传入的data参数(也就是原数据框)去匹配列名,而不是直接接收Series对象。

额外说明

  • 如果你的分类特征列是字符串或object类型,Statsmodels会自动将其识别为分类变量,OLS模型会自动生成虚拟变量,对应的ANOVA结果也会正确反映组间差异。
  • 如果你需要指定typ=2或typ=3的ANOVA类型,直接在anova_lm里修改参数即可,和之前的逻辑一致。

内容的提问来源于stack exchange,提问作者julian joseph

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 06:23:44