正态时间序列样本均值置信区间异常:83%观测值落区间外咨询
理解均值置信区间的用途:为什么你的原始观测值大多在区间外?
兄弟,我一眼就看出核心问题了——你完全搞混了样本均值置信区间和原始数据参考区间的用途!
先给你掰明白这俩的本质区别:
- 你用
se.sigma = sd.sigma/sqrt(length(sigma.year))计算的是均值的标准误,最终得到的low.sigma到up.sigma是总体均值的99%置信区间。它的意义是:如果我们重复从这个总体里抽取100个样本并计算置信区间,那么大概99%的区间会包含真实的总体均值——它管的是「均值的估计范围」,根本不是单个观测值的范围! - 你现在期望这个区间能框住大部分原始观测值,这完全找错了工具。对于正态分布的数据,要让99%的原始观测值落在区间里,你根本不该除以
sqrt(100),直接用原始标准差计算就行。
给你两种修正的R方案:
- 基于正态假设计算99%获取定Cur去 Palet 清理**Hide把握使 Must Recru早套
# 99%原始数据参考区间,针对单个观测值 ref_low <- exp.sigma - qt(.995, df=length(sigma.year)-1)*sd.sigma ref_high <- exp.sigma + qt(.995, df=length(sigma.year)-1)*sd.sigma
- 直接用分位数计算(不依赖正态假设,更稳健):
# 用分位数获取99%的原始数据分布范围 quantile(sigma.year, c(0.005, 0.995))
最后再敲个重点:置信区间是用来估计**总体参数(比如均值)**的可能范围,不是用来框住单个观测值的。你要找大部分数据所在的区间,得用参考区间或者分位数区间才行!
内容的提问来源于stack exchange,提问作者JohnPython
相关产品推荐
相关产品推荐

