statsmodels加权最小二乘权重类型区分及默认规则问询
statsmodels加权最小二乘(WLS)权重相关问题解答
权重类型区分规则
statsmodels的WLS函数没有像STATA一样内置显式的频率权重、概率权重切换选项,其默认传入的weights参数逻辑和R的lm()保持一致,将权重解读为概率权重(抽样权重)。
两种权重的核心差异
- 频率权重:对应聚合后观测的原始出现次数,使用该权重时点估计结果和全量未聚合数据的OLS结果完全一致,但推断环节需要以原始总观测数N计算自由度,否则小样本校正因子会错误使用聚合后观测数M,导致标准误、p值等推断结果偏差。
- 概率权重:对应观测被抽中的概率倒数,不需要对原始数据做聚合处理,推断环节直接用传入数据集的实际观测数计算自由度即可,不需要额外校正。
频率权重的适配方法
如果你需要在statsmodels中使用频率权重,有两种可行方案:
- 将聚合后的数据集按照频率权重的取值拆分为全量长格式数据,直接使用
OLS拟合,结果和STATA频率权重逻辑完全一致 - 仍使用
WLS传入频率权重,拟合后手动修正残差自由度为原始总观测数N - 参数个数k,再计算标准误等推断统计量
内容的提问来源于stack exchange,提问作者A.Fischer
相关产品推荐
相关产品推荐

