You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

多项试验场景下检测总体所有亚组所需最小样本量的计算方法咨询

咱们先把问题拆解清楚——你说的场景本质是不放回版的优惠券收集问题,刚好对应多项试验里的全覆盖抽样需求,我分两种最常见的需求场景给你解答:

一、最坏情况:绝对保证抽到所有亚组的最小样本量

这种情况是考虑“最倒霉”的极端场景:你抽了一大堆样本,却刚好漏掉某一个亚组,直到把其他所有样本都抽完,最后一个才抽到那个漏掉的亚组。

计算逻辑很直接:

  • 假设7个亚组的样本量分别为 ( n_1, n_2, ..., n_7 ),且 ( n_1 + n_2 + ... + n_7 = 1000 )
  • 找到样本量最小的那个亚组,记它的大小为 ( \min(n_i) )
  • 最坏情况下的最小样本量 ( N = (1000 - \min(n_i)) + 1 )

举个例子:如果最小的亚组有5个样本,那你最多可能先抽完其他995个样本(刚好没碰这个亚组),再抽1个就必然覆盖所有亚组,也就是总共需要996个样本。

如果不知道每个亚组的具体大小,那保守的最坏情况估计是 ( N=1000 )——因为你无法排除某个亚组只有1个样本的可能,这种情况下必须抽完所有样本才能保证覆盖所有亚组。

二、给定置信水平下:以指定概率抽到所有亚组的最小样本量

实际研究里,没人会用最坏情况的样本量(太浪费了),通常我们需要的是“有X%的概率能抽到所有亚组”的最小样本量,比如95%置信水平。

这里需要用容斥原理结合超几何分布计算:

  1. 先算补概率:抽取N个样本后,至少漏掉一个亚组的概率
  2. 用1减去补概率,得到“覆盖所有亚组”的概率P
  3. 迭代调整N,找到最小的N使得 ( P \geq \text{你的目标置信水平} )

具体的计算公式(容斥原理):

P = 1 - Σ [ (-1)^(|S|+1) * C(Σn_i∈S, N) / C(1000, N) ]

其中:

  • ( S ) 是所有非空的亚组子集(比如单个亚组、两个亚组的组合等)
  • ( |S| ) 是子集里的亚组数量
  • ( C(a,b) ) 是组合数,代表从a个元素中选b个的选法数

举个实操例子:如果7个亚组的大小比较均匀(比如每个约143个),你可以从N=20左右开始试算,逐步增大N,直到P达到95%——实际计算下来,这个N会远小于最坏情况的数值。

如果亚组大小都远小于总体,也可以用放回版优惠券收集问题的结果做近似,再稍微上调一点样本量就好,计算起来更简单。


内容的提问来源于stack exchange,提问作者user9446044

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.30 10:49:05