为何谷歌《自然·数字医学》新医学预测论文采用测试集Bootstrap法?
这个问题得结合医疗AI研究的严谨性需求和Bootstrap方法本身的统计特性来拆解,具体原因可以分成这几点:
弥补单一测试集的点估计缺陷
电子健康记录(EHR)数据本身个体差异大、样本分布可能不均,只靠一次测试集算出的准确率只是个孤立的"点估计",没法体现模型性能的波动范围。Bootstrap通过从测试集有放回重复抽样生成1000个独立样本,能模拟不同的测试场景,让我们得到更稳健的性能波动估计,不会因为某次测试集的随机划分就得出偏差较大的结论。满足医学领域的可靠性要求
医疗场景下,模型性能的可信度直接关系到临床决策,没人愿意用一个性能波动范围未知的模型。用Bootstrap算出的95%置信区间,能清晰告诉读者:"这个模型的真实性能有95%的概率落在这个区间内",比单独给一个准确率数值更有临床参考价值,也符合医学研究对统计严谨性的要求。充分利用有限的测试集信息
论文里测试集只占总数据的10%,样本量相对有限。Bootstrap能在不额外扩充数据的前提下,通过重抽样充分挖掘测试集的统计信息,避免小样本带来的性能估计不稳定问题,让最终的评估结果更具说服力。
论文中也明确说明了这一设计:
模型评估与统计分析:患者被随机划分为开发集(80%)、验证集(10%)和测试集(10%)。模型准确率基于测试集报告,并采用1000个Bootstrap样本计算95%置信区间。
该研究来自Rajkomar, A.等人2018年的《面向电子健康记录的可扩展高精度深度学习》,选择Bootstrap方法本质是为了让模型性能评估更贴合医学研究的严谨标准,同时解决小测试集带来的统计稳定性不足问题。
内容的提问来源于stack exchange,提问作者Samuel Weisenthal

