无放回随机抽样下特征样本的概率及占比问题的统计方法问询
先明确几个关键参数:总记录数 ( N = 4000 ) 万,含特定词汇的目标记录数 ( K = X ),无放回抽取的样本量 ( n = 2500 ) 万。
问题1:抽取样本包含部分或全部X条目标记录的概率
这个概率可以用补集思想简化计算——先算出“样本里完全没有任何目标记录”的概率,再用1减去这个值就是我们要的结果,毕竟“包含部分或全部”的反面就是“一条都没抽到”。
无放回抽样的场景下,这类问题属于超几何分布的应用范畴,具体公式如下:
[
P(\text{包含至少1条目标记录}) = 1 - \frac{\binom{N-K}{n}}{\binom{N}{n}}
]
其中:
- ( \binom{a}{b} ) 表示组合数,即从 ( a ) 个元素中无放回选取 ( b ) 个的所有可能方式数,计算逻辑为 ( \binom{a}{b} = \frac{a!}{b!(a-b)!} )
- ( \binom{N-K}{n} ) 是从非目标记录(共 ( N-K ) 条)中抽取 ( n ) 条的组合数
- ( \binom{N}{n} ) 是从所有记录中抽取 ( n ) 条的总组合数
举个直观的例子:如果X=1000,代入公式就能算出具体概率;当X本身比较大时,这个概率会非常接近1——毕竟我们抽了超过一半的样本量,很难完全避开所有目标记录。
问题2:X条目标记录在样本中的数量与占比
期望数量
无放回抽样中,每条目标记录被抽到的概率是 ( \frac{n}{N} )(也就是总样本的占比 ( \frac{2500万}{4000万} = 62.5% ))。根据线性期望的性质,不管抽样是否放回,目标记录在样本中的期望数量都是:
[
E[\text{目标记录数}] = X \times \frac{n}{N} = X \times 0.625
]
期望占比
样本中目标记录的期望占比就是总抽样比例,也就是 ( 62.5% )。这是因为无放回抽样不会改变总体的比例期望——虽然实际抽出来的数量是随机波动的,但长期重复抽样的话,样本占比会趋近于总体的真实占比。
如果需要更细致地描述这个数量的分布,它严格服从超几何分布,方差为 ( X \times \frac{n}{N} \times \left(1 - \frac{n}{N}\right) \times \frac{N-n}{N-1} ),不过大部分业务场景下,知道期望数值就足够指导决策了。
内容的提问来源于stack exchange,提问作者Mah

