新冠患者突变与重症关联的统计检验方法咨询:对比突变重症频率与总体比例并纳入样本量考量
新冠患者突变与重症关联的统计检验方法咨询:对比突变重症频率与总体比例并纳入样本量考量
首先得给你明确:你要做的其实是针对每个突变的单比例检验——对比该突变携带者中的重症比例是否等于总体的重症比例(1/8),而你担心的样本量影响,这类检验天然就会考虑进去,不用额外操作。
先说说你提到的卡方齐性检验为什么不太合适:齐性检验是用来比较多个组之间的比例是否一致(比如不同突变组的重症比例有没有差异),但你的需求是每个突变单独和总体比例(1/8)做对比,不是组间比较,所以这个方法不对症。
下面给你推荐最适合的几种方法,按直接程度排序:
1. 单样本二项式检验(Binomial Test)
这是最贴合你需求的方法:
- 对每个符合条件的突变X,你有
n个携带者(n≥30),其中k个是重症患者 - 你的零假设是:该突变携带者的重症比例
p = 1/8,备择假设可以是双侧(p≠1/8)或者单侧(比如怀疑突变会升高重症风险,就用p>1/8) - 这个检验会直接基于
n和k计算观测结果在零假设下的概率:同样的比例差异,n越大,检验的统计效力越高,显著性也越容易达标——完全符合你说的“5000个携带者的突变即使比例0.5,也比30个携带者的0.9更显著”的场景。
2. 正态近似的单样本Z检验
当n足够大时(比如你已经筛选了n≥30,且n*1/8和n*7/8都≥5,大部分突变应该满足),可以用Z检验来近似二项式检验,计算更简便:
公式是:
Z = (p̂ - p₀) / sqrt(p₀*(1-p₀)/n)
其中p̂ = k/n是该突变的观测重症比例,p₀=1/8是总体重症比例。
这个Z统计量的平方和卡方拟合优度检验的结果是等价的,大样本下和二项式检验的结论几乎一致。
3. 必须注意的多重检验校正
因为你要对所有符合条件的突变逐一做检验,这会带来多重比较的问题——即使没有真实关联,也可能因为检验次数多而出现假阳性结果。所以一定要做校正:
- 如果你想严格控制假阳性率(Type I Error),可以用Bonferroni校正:把你的显著性水平(比如α=0.05)除以检验的突变总数
- 如果你更关注发现真实关联的同时控制假发现率(FDR),推荐用Benjamini-Hochberg(BH)法,这个方法在基因组/突变分析中很常用,比Bonferroni更灵活,统计效力更高。
补充:关于卡方检验的正确用法
如果你一定要用卡方检验,应该用卡方拟合优度检验,而不是齐性检验:
- 对每个突变X,构建观测频数:重症k例,非重症n-k例
- 计算期望频数:重症
n*1/8例,非重症n*7/8例 - 计算卡方统计量:
Σ((观测值-期望值)²/期望值) - 这个检验的结论和单样本Z检验(大样本下)、二项式检验是一致的,但本质还是单比例检验的变种。
最后想说,你已经做过机器学习特征选择,再用统计检验来验证关联的思路很稳妥,统计检验能帮你从统计显著性的角度确认那些突变的真实关联,避免机器学习可能带来的过拟合问题。
备注:内容来源于stack exchange,提问作者mather123
相关产品推荐
相关产品推荐

