模拟法计算P值时,应基于原假设均值还是观测样本均值?
模拟法计算双侧P值:正确方法解析
结论:Method 1是符合P值定义的正确方法,Method 2是错误的
P值的核心逻辑
P值的本质是:原假设H₀成立时,观测到与实际检验统计量同样极端或更极端结果的概率。这里的关键前提是必须基于原假设的参数生成零分布——也就是默认总体均值μ=22为真实值,在这个前提下模拟样本均值的分布,再判断实际观测值x̄=20.09的极端程度。
Method 1的正确性分析
Method 1完全遵循P值的定义(注:原代码中20应替换为实际观测值20.09才准确):
samp <- replicate(n_samples, mean(rnorm(n = 30, mean = 22, sd = 3))) two.sided.pval <- 2*min(c(mean(samp >= 20.09), mean(samp <= 20.09)))
- 第一步用
mean=22生成样本均值的零分布,严格对应H₀成立的前提; - 第二步计算零分布中,样本均值≤20.09(和观测值同向极端),以及≥22+(22-20.09)=23.91(观测值关于原假设均值的反向极端值)的比例,取较小值乘以2得到双侧P值,完全符合双侧检验“更极端”的判定标准。
Method 2的错误原因
Method 2用观测到的样本均值mean=20生成分布,本质是基于备择假设的某个特定值构建分布,彻底违背了P值“在原假设成立下计算概率”的核心要求。这样得到的结果根本不是P值,无法用来判断原假设是否成立。
总结
你对P值定义的理解是完全正确的,必须基于H₀的参数(μ=22)生成零分布来计算P值,教程采用的Method 2是错误的。
内容的提问来源于stack exchange,提问作者KLee
相关产品推荐
相关产品推荐

