You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于伯努利检验的两类硬币识别所需样本量的技术咨询

基于伯努利检验的两类硬币识别所需样本量的技术咨询

嘿,这个问题看起来直白,但概率统计里的样本量计算有时候就是容易卡壳,我来帮你理一理思路~

首先明确核心:你要的是假设检验的样本量计算,而不是单纯的置信区间估计——这也是你之前的思路可能不太对的原因,置信区间是针对单个样本的参数范围,而我们需要的是通过样本数据,以95%的置信度区分两个明确的概率分布(p=0.5和p=0.45)。


一、单个硬币抛N次的情况

我们需要设定两个对立假设:

  • H₀:硬币是公平的(p=0.5)
  • H₁:硬币是偏倚的(p=0.45)

目标是找到最小的N,使得:

  1. 把公平硬币误判为偏倚的概率≤5%(第一类错误α≤0.05)
  2. 把偏倚硬币误判为公平的概率≤5%(第二类错误β≤0.05,即检验功效1-β≥0.95)

近似计算(正态近似法)

当N足够大时,二项分布X~Bin(N,p)可以近似为正态分布N(Np, Np(1-p)):

  • 公平硬币的正面次数X₀近似服从N(0.5N, 0.25N)
  • 偏倚硬币的正面次数X₁近似服从N(0.45N, 0.45×0.55N)=N(0.45N, 0.2475N)

我们需要找到N,使得H₀下的5%左侧分位数,大于H₁下的95%右侧分位数(这样两个分布的“决策区域”不重叠,误判概率控制在5%以内):

0.5N - 1.645×√(0.25N) ≥ 0.45N + 1.645×√(0.2475N)

化简求解:

  • 0.05N ≥ 1.645×(0.5√N + √(0.2475)√N)
  • 0.05√N ≥ 1.645×(0.5 + 0.4975) ≈ 1.641
  • √N ≈ 32.82 → N≈1077

实际用二项分布精确计算的话,N大概在1100左右,和近似值相差不大。


二、两人分别抛硬币的情况(各抛N次)

你的直觉没错!两组样本的信息确实能让需要的N更小,因为我们可以直接比较两组的正面次数差异,信息利用率更高。

设定场景:X是公平硬币的正面次数(XBin(N,0.5)),Y是偏倚硬币的正面次数(YBin(N,0.45)),我们需要判断哪个来自p=0.5,哪个来自p=0.45。

近似计算(正态近似法)

X-Y的分布在真实情况下近似服从N(0.5N-0.45N, 0.25N+0.2475N)=N(0.05N, 0.4975N),标准差≈0.7053√N。

我们需要让“误判”的概率≤5%:即当X确实来自p=0.5时,Y>X的概率≤5%(也就是X-Y>0的概率≥95%)。对应正态分布的分位数条件:

0 ≤ 0.05N - 1.645×0.7053√N

化简求解:

  • 0.05√N ≥ 1.645×0.7053≈1.1602
  • √N≈23.2 → N≈538

这个数值比单个样本的情况小近一半,完全符合你“信息更多,N更小”的直觉。


关于你之前的置信区间思路

你提到的“公平硬币置信下限大于偏倚硬币置信上限”的思路,本质上是一种保守的检验方法——它能保证区分的置信度,但计算出的N会比假设检验的功效分析更大,因为置信区间是针对单个参数的估计范围,没有利用“只有两个可能的p值”这个前提信息。

备注:内容来源于stack exchange,提问作者Tim Flack

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.23 11:39:52