You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

无放回随机抽样下特征样本的概率及占比问题的统计方法问询

解答:无放回抽样的概率与样本占比问题

先明确几个关键参数:总记录数 ( N = 4000 ) 万,含特定词汇的目标记录数 ( K = X ),无放回抽取的样本量 ( n = 2500 ) 万。

问题1:抽取样本包含部分或全部X条目标记录的概率

这个概率可以用补集思想简化计算——先算出“样本里完全没有任何目标记录”的概率,再用1减去这个值就是我们要的结果,毕竟“包含部分或全部”的反面就是“一条都没抽到”。

无放回抽样的场景下,这类问题属于超几何分布的应用范畴,具体公式如下:
[
P(\text{包含至少1条目标记录}) = 1 - \frac{\binom{N-K}{n}}{\binom{N}{n}}
]
其中:

  • ( \binom{a}{b} ) 表示组合数,即从 ( a ) 个元素中无放回选取 ( b ) 个的所有可能方式数,计算逻辑为 ( \binom{a}{b} = \frac{a!}{b!(a-b)!} )
  • ( \binom{N-K}{n} ) 是从非目标记录(共 ( N-K ) 条)中抽取 ( n ) 条的组合数
  • ( \binom{N}{n} ) 是从所有记录中抽取 ( n ) 条的总组合数

举个直观的例子:如果X=1000,代入公式就能算出具体概率;当X本身比较大时,这个概率会非常接近1——毕竟我们抽了超过一半的样本量,很难完全避开所有目标记录。

问题2:X条目标记录在样本中的数量与占比

期望数量

无放回抽样中,每条目标记录被抽到的概率是 ( \frac{n}{N} )(也就是总样本的占比 ( \frac{2500万}{4000万} = 62.5% ))。根据线性期望的性质,不管抽样是否放回,目标记录在样本中的期望数量都是:
[
E[\text{目标记录数}] = X \times \frac{n}{N} = X \times 0.625
]

期望占比

样本中目标记录的期望占比就是总抽样比例,也就是 ( 62.5% )。这是因为无放回抽样不会改变总体的比例期望——虽然实际抽出来的数量是随机波动的,但长期重复抽样的话,样本占比会趋近于总体的真实占比。

如果需要更细致地描述这个数量的分布,它严格服从超几何分布,方差为 ( X \times \frac{n}{N} \times \left(1 - \frac{n}{N}\right) \times \frac{N-n}{N-1} ),不过大部分业务场景下,知道期望数值就足够指导决策了。

内容的提问来源于stack exchange,提问作者Mah

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 04:04:39