You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

n个数字随机抽样后,至少一个选中次数超出9700-10300的概率求解

问题分析与解答

首先咱们先把问题的核心设定理清楚:

  • 手里有n个数字(从1到n),每次随机选一个,总共选 (10000 \times n) 次
  • 每个数字被选中的期望次数是10000,现在要算至少有一个数字的选中次数不在[9700, 10300]区间内的概率

1. 单个数字的选中次数分布

随便挑一个数字来看,它的选中次数 (X_i) 服从二项分布 (Binomial(N, p)),其中:

  • (N = 10000n)(总试验次数)
  • (p = \frac{1}{n})(每次选中这个数字的概率)

这个分布的关键参数:

  • 均值 (\mu = Np = 10000n \times \frac{1}{n} = 10000)
  • 方差 (\sigma^2 = Np(1-p) = 10000n \times \frac{1}{n} \times \frac{n-1}{n} = 10000 \times \frac{n-1}{n})
  • 标准差 (\sigma = \sqrt{10000 \times \frac{n-1}{n}} = 100 \times \sqrt{\frac{n-1}{n}})

当n不是特别小(比如n≥5)时,(\frac{n-1}{n}) 接近1,标准差σ≈100,这时候二项分布可以用正态分布近似:(X_i \sim N(\mu=10000, \sigma^2 \approx 10000))


2. 单个数字超出区间的概率q

我们需要算单个数字选中次数<9700或>10300的概率,也就是:
[ q = P(X_i < 9700) + P(X_i > 10300) ]

因为正态分布是对称的,这两个概率相等,所以可以简化成:
[ q = 2 \times P(X_i < 9700) ]

把数值标准化算z-score:
[ z = \frac{9700 - \mu}{\sigma} = \frac{9700 - 10000}{100 \times \sqrt{\frac{n-1}{n}}} = \frac{-3}{\sqrt{\frac{n-1}{n}}} ]

当n较大时,(\sqrt{\frac{n-1}{n}} \approx 1),z≈-3。查标准正态分布表,(P(Z < -3) \approx 0.00135),所以q≈2×0.00135=0.0027。如果n很小,比如n=2,σ≈70.71,z≈-4.24,对应的概率会极低(约2.2×10⁻⁵)。


3. 至少一个数字超出区间的概率

直接算“至少一个超出”的概率太麻烦,咱们用补集思想:先算所有数字都在[9700,10300]内的概率,再用1减去这个值。

假设各个数字的选中次数近似独立(n越大,这个假设越准确,因为总次数固定带来的相关性会变弱),那么所有数字都在区间内的概率是:
[ P(\text{全部在区间内}) = (1 - q)^n ]

因此,至少有一个数字超出区间的概率就是:
[ P(\text{至少一个超出}) = 1 - (1 - q)^n ]

不同n值的结果示例

  • 当n=1000时,q≈0.0027,((1-0.0027)^{1000} \approx e^{-2.7} ≈ 0.067),概率≈93.3%
  • 当n=100时,((1-0.0027){100}≈e{-0.27}≈0.763),概率≈23.7%
  • 当n=10时,((1-0.0027)^{10}≈0.973),概率≈2.7%
  • 当n=2时,q≈2.2×10⁻⁵,概率≈4.4×10⁻⁵(几乎可以忽略)

注意事项

  1. 正态近似的边界情况:如果n=1,总选中次数就是10000,刚好落在区间内,概率为0,这时候不能用正态近似。
  2. 相关性的影响:因为总选中次数固定,各个数字的选中次数不是完全独立的,但n越大,这种相关性越弱,近似独立的假设就越可靠。

内容的提问来源于stack exchange,提问作者mechap

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 08:34:59