You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

新冠患者突变与重症关联的统计检验方法咨询:对比突变重症频率与总体比例并纳入样本量考量

新冠患者突变与重症关联的统计检验方法咨询:对比突变重症频率与总体比例并纳入样本量考量

首先得给你明确:你要做的其实是针对每个突变的单比例检验——对比该突变携带者中的重症比例是否等于总体的重症比例(1/8),而你担心的样本量影响,这类检验天然就会考虑进去,不用额外操作。

先说说你提到的卡方齐性检验为什么不太合适:齐性检验是用来比较多个组之间的比例是否一致(比如不同突变组的重症比例有没有差异),但你的需求是每个突变单独和总体比例(1/8)做对比,不是组间比较,所以这个方法不对症。

下面给你推荐最适合的几种方法,按直接程度排序:

1. 单样本二项式检验(Binomial Test)

这是最贴合你需求的方法:

  • 对每个符合条件的突变X,你有n个携带者(n≥30),其中k个是重症患者
  • 你的零假设是:该突变携带者的重症比例p = 1/8,备择假设可以是双侧(p≠1/8)或者单侧(比如怀疑突变会升高重症风险,就用p>1/8)
  • 这个检验会直接基于n和k计算观测结果在零假设下的概率:同样的比例差异,n越大,检验的统计效力越高,显著性也越容易达标——完全符合你说的“5000个携带者的突变即使比例0.5,也比30个携带者的0.9更显著”的场景。

2. 正态近似的单样本Z检验

当n足够大时(比如你已经筛选了n≥30,且n*1/8和n*7/8都≥5,大部分突变应该满足),可以用Z检验来近似二项式检验,计算更简便:
公式是:

Z = (p̂ - p₀) / sqrt(p₀*(1-p₀)/n)

其中p̂ = k/n是该突变的观测重症比例,p₀=1/8是总体重症比例。
这个Z统计量的平方和卡方拟合优度检验的结果是等价的,大样本下和二项式检验的结论几乎一致。

3. 必须注意的多重检验校正

因为你要对所有符合条件的突变逐一做检验,这会带来多重比较的问题——即使没有真实关联,也可能因为检验次数多而出现假阳性结果。所以一定要做校正:

  • 如果你想严格控制假阳性率(Type I Error),可以用Bonferroni校正:把你的显著性水平(比如α=0.05)除以检验的突变总数
  • 如果你更关注发现真实关联的同时控制假发现率(FDR),推荐用Benjamini-Hochberg(BH)法,这个方法在基因组/突变分析中很常用,比Bonferroni更灵活,统计效力更高。

补充:关于卡方检验的正确用法

如果你一定要用卡方检验,应该用卡方拟合优度检验,而不是齐性检验:

  • 对每个突变X,构建观测频数:重症k例,非重症n-k例
  • 计算期望频数:重症n*1/8例,非重症n*7/8例
  • 计算卡方统计量:Σ((观测值-期望值)²/期望值)
  • 这个检验的结论和单样本Z检验(大样本下)、二项式检验是一致的,但本质还是单比例检验的变种。

最后想说,你已经做过机器学习特征选择,再用统计检验来验证关联的思路很稳妥,统计检验能帮你从统计显著性的角度确认那些突变的真实关联,避免机器学习可能带来的过拟合问题。

备注:内容来源于stack exchange,提问作者mather123

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.22 15:24:31