fitdistplus中gofstat函数:离散值拟合结果的解读疑问
计数分布拟合优度评估解答
问题背景
使用fitdistplus包的fitdist()函数为计数数据拟合泊松分布和负二项分布,通过gofstat()评估拟合效果,需验证负二项分布更优的结论,并解读卡方检验结果。
代码与输出
fnb <- fitdist(GrpSz_15$n_ans, "nbinom") fpn <- fitdist(GrpSz_15$n_ans, "pois") gofstat(list(fnb, fpn), fitnames = c("nbinom", "pois"))
输出结果:
Chi-squared statistic: 31.18916 73.59646 Degree of freedom of the Chi-squared distribution: 2 3 Chi-squared p-value: 1.687951e-07 7.242443e-16 the p-value may be wrong with some theoretical counts < 5 Chi-squared table: obscounts theo nbinom theo pois <= 2 99 68.874052 58.085759 <= 3 28 29.652668 36.857060 <= 4 16 23.929827 31.043298 <= 7 13 35.975958 38.315366 > 7 12 9.567495 3.698518 Goodness-of-fit criteria nbinom pois Akaike's Information Criterion 713.3276 752.3945 Bayesian Information Criterion 719.5755 755.5185
解答
1. 信息准则判断负二项更优是否正确?
完全正确。AIC(赤池信息准则)和BIC(贝叶斯信息准则)的核心逻辑是在权衡拟合优度与模型复杂度的前提下,数值越低代表模型越优:
- 负二项的AIC比泊松低近40,BIC低近36,差距非常显著;
- 负二项比泊松多一个离散参数,即使引入额外参数带来了复杂度惩罚,其信息准则仍远低于泊松,说明该参数带来的拟合精度提升远超过复杂度增加的代价,足以证明负二项的拟合效果显著优于泊松。
2. 卡方表的解读
卡方表的核心是对比观测计数(obscounts)与各分布的理论计数,原则是:理论值与观测值越接近,拟合效果越好。
从表格数据看:
- 负二项的理论计数整体更贴近观测值,比如>
7区间,负二项的理论值9.57远接近观测的12,而泊松仅为3.7,差距极大; - 泊松在多个区间(如
<=2、>7)的理论值与观测值偏差明显,说明泊松无法捕捉数据的过度离散特性(即尾部的高计数),而负二项能更好地适配这类数据。
3. 卡方p值的解读
卡方拟合优度检验的原假设是「数据服从目标分布」,p值的含义是:在原假设成立的前提下,观测到当前或更极端卡方统计量的概率。
- 两个分布的p值都极小(远小于0.05),看似都要拒绝原假设,但注意输出中的提示:
the p-value may be wrong with some theoretical counts < 5——泊松的>7区间理论值仅3.7,小于5,违反了卡方检验的前提要求(每个区间理论计数需≥5),因此泊松的p值完全不可靠; - 负二项的所有区间理论值均≥5,其p值相对可靠,但p值过小可能是大样本效应导致:当样本量较大时,卡方检验对微小的拟合差异也会变得异常敏感,即使实际拟合效果不错,也会拒绝原假设。
4. 是否两个分布都不合适?
不是。判断模型是否合适不能仅看卡方检验的拒绝结果,需结合多个指标综合判断:
- 信息准则明确负二项远优于泊松;
- 卡方表显示负二项的理论值与观测值的贴合度远高于泊松;
- 卡方检验的显著拒绝更多是大样本下的统计特性,而非模型完全不可用。在实际分析中,负二项是更适配该计数数据的模型。
内容的提问来源于stack exchange,提问作者mikejwilliamson
相关产品推荐
相关产品推荐

