You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Poisson模型输出SE与Bootstrapped SE差异显著的原因咨询

Poisson GLM默认输出SE远小于非参Bootstrap SE的常见原因

两种SE的计算逻辑从根上就不一样:Poisson GLMsummary()输出的是基于模型强假设的大样本渐近标准误,你做的案例重抽样非参Bootstrap SE是不依赖模型分布假设的经验抽样误差,二者出现明显偏差、且模型输出SE偏小的原因按出现概率从高到低排列:

  • 核心原因:泊松模型的等离散假设不成立,存在过度离散
    泊松分布的固有约束是方差等于均值(Var(Y)=μ),模型默认输出的SE完全是基于这个假设计算的。但实际计数数据几乎都存在过度离散——也就是真实方差远大于均值,常见诱因包括未观测的个体异质性、数据存在大量零值、样本存在组内聚类、事件发生存在相关性。这时候模型默认SE会系统性低估真实变异,低估的比例刚好是1/√(离散度参数)。而非参Bootstrap完全不依赖泊松分布的方差假设,重抽样过程会直接捕捉到数据里的额外变异,算出来的SE自然大很多。如果是这个原因,你换拟泊松、负二项模型调整离散度后,输出的SE会和Bootstrap结果大幅趋近。
  • 模型存在设定偏误
    GLM默认SE的计算前提是「模型设定100%正确」:包括连接函数选对、线性预测项的形式完全正确(没有遗漏非线性关系、交互项、关键混淆变量)、没有强影响离群值。只要模型存在设定偏误,默认SE不会把偏误带来的系数波动算进误差里。而非参Bootstrap不假设模型正确,重抽样过程中会自然把模型设定缺陷带来的系数变异纳入SD计算,结果自然比默认SE大。
  • Bootstrap实现流程存在问题
    很多人算Bootstrap SE的时候容易踩几个细节坑,导致结果虚高:
    • 没有剔除收敛失败的迭代样本:部分重抽样本可能存在某亚组结局全0、预测值完全分离的情况,这时候Poisson模型迭代不收敛,会输出极端异常的系数值,这些离群值会把整体SD拉高。你可以先画1000次迭代系数的分布,把收敛标记为FALSE、或者系数偏离原系数3倍以上的异常值剔除后再算SD。
    • 重抽样逻辑和数据生成结构不匹配:如果你的数据是分层、聚类、面板结构,却用了简单随机有放回抽单个观测的方式,重抽样本会破坏原数据的组内相关结构,也可能导致SE估计偏误。
    • 迭代次数不足:1000次迭代对于分布偏斜的计数数据来说,SD的蒙特卡洛误差可能不小,你可以把迭代次数加到5000次,看结果是否收敛稳定。
  • 样本量不足,渐近假设不成立
    GLM输出的SE是大样本渐近推导的结果,当你的样本量很小、或者核心解释变量是取值极少的分类变量/稀有事件变量时,渐近SE的有限样本偏差会很明显,通常表现为低估真实抽样变异,这时候Bootstrap的有限样本表现反而更可靠。

快速排查步骤:

  1. 先算模型的离散度:用模型的残差偏差除以残差自由度,若结果远大于1(比如>1.5),基本可以确定是过度离散导致的SE低估
  2. 检查所有Bootstrap迭代的收敛状态与系数分布,剔除异常值后重算SE
  3. 绘制模型残差和拟合值、核心解释变量的关系图,排查是否存在未建模的非线性、异方差、聚类结构

内容的提问来源于stack exchange,提问作者user3669725

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 23:27:11