You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

DataCamp课程中np.percentile与1.96*np.sqrt计算置信区间的区别

两种95%置信区间计算方法的区别与适用场景

你看到的两种计算置信区间的方法,分别对应非参数Bootstrap百分位置信区间和正态近似置信区间,核心差异在于是否假设统计量的抽样分布服从正态分布,具体区别和适用场景如下:

  • np.percentile(mean_lengths, [2.5, 97.5]) :百分位法置信区间
    这个方法完全基于Bootstrap重抽样得到的统计量经验分布,你代码里的mean_lengths就是对原始样本多次重抽样后,每次计算得到的平均长度的集合。直接对这个集合排序后取2.5%和97.5%位置的数值,就是95%置信区间的上下限。
    它的优势是不需要对总体分布、统计量的抽样分布做任何前提假设,哪怕你要计算的是中位数、分位数、相关系数这类抽样分布不对称的统计量,也能得到相对可靠的结果;唯一的要求是重抽样的次数足够多,否则结果波动会比较大。
  • 1.96 * np.sqrt(jk_var) :正态近似置信区间
    这个方法的前提是你计算的统计量的抽样分布服从正态分布,代码注释里的Assuming normality也明确标注了这个前提。1.96是标准正态分布双侧覆盖95%概率对应的分位点,np.sqrt(jk_var)就是统计量的标准误,用统计量的点估计值加减1.96倍标准误就得到了置信区间。
    它的优势是计算简单,只要能算出统计量的方差就能得到结果,不需要做多次重抽样;但限制非常明确:如果统计量的抽样分布偏态明显、或者样本量很小,正态假设不成立的情况下,算出来的区间误差会非常大,甚至完全不符合实际情况。

适用场景选择参考:

  • 优先选百分位法:你已经通过Bootstrap/刀切法等重抽样方法得到了足够多的统计量抽样结果、统计量本身的抽样分布不对称(比如中位数、风险比、小样本下的比例等)、样本量较小无法保证正态假设成立
  • 可以用正态近似法:样本量足够大(通常要求至少30以上,部分统计量要求更高)、统计量的抽样分布已经被证明是渐近正态的(比如大样本下的均值)、没有条件做重抽样只能用解析方法计算标准误

小提示:你贴的第一段Bootstrap计算代码末尾的enter code here是多余的无效内容,实际运行时可以直接删除。

内容的提问来源于stack exchange,提问作者ธนาคาร ฉั่ว

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.23 15:06:07