You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

机器学习临床建模中如何处理缺失率超80%的特征

高缺失率临床数据集建模处理方案

300样本、400特征属于典型的小样本高维临床数据,针对要求保留的高缺失率生物学相关特征,不要上来就直接做全局填充,按以下流程处理即可:

  • 第一步先判定缺失机制:先梳理每个高缺失特征的缺失原因,区分是完全随机缺失(如设备随机漏采、数据导出丢失)、随机缺失(如某年龄段/某就诊批次的患者统一未做该项检测)、非随机缺失(如医生判断患者不需要做该项检测、患者病情过重无法完成检测)。临床场景中非随机缺失占比极高,缺失状态本身就是有预测价值的信息,不是需要完全抹除的数据噪声。
  • 缺失率80%以上的必保特征:不要做常规统计量填充,优先做特征拆分:一是衍生[特征名]_is_missing的二值变量,标记样本是否在该特征上缺失,保留缺失本身的信息;二是保留该特征的非缺失原值,缺失位置留空,优先选择LightGBM、XGBoost这类原生支持缺失值分裂的树模型建模,这类模型会自动学习缺失值的最优分裂方向,不需要提前人工填充。如果必须用逻辑回归、SVM这类不支持原生缺失输入的模型,再针对非缺失部分做多重插补,不要用全局统计量填值。
  • 缺失率50%-80%的必保特征:同样先加上述的缺失指示变量;如果特征是分类变量,直接把“缺失”设为一个独立的分类水平即可,不要强行归到其他已有类别;如果是连续变量,优先用和结局、临床亚组绑定的有监督插补(比如按结局分组、按疾病亚型分组计算组内中位数/众数填充,或者用纳入了结局变量的MICE多重插补),不要用无监督的全局统计量填充。
  • 额外注意:因为当前数据集特征数多于样本数,处理完缺失后要先做单因素关联筛选,剔除和建模结局无统计显著性的冗余特征,避免维度太高导致模型过拟合。
全局众数填充的性能影响

全局众数填充(即拿整个数据集该特征出现频次最高的值填所有缺失位置)在高缺失率场景下几乎一定会损伤模型性能,核心原因如下:

  • 该方法会大幅压缩特征本身的方差,把大量异质性的缺失样本强行归到同一个取值上,直接弱化特征和结局的真实关联,严重时会引入完全错误的虚假关联。比如某肿瘤标记物80%缺失,非缺失样本中异常升高占比40%,全局众数是“正常”,把所有缺失值填成“正常”相当于把“未检测”的人群和真实指标正常的人群完全混同,模型学到的关联完全偏离真实临床逻辑。
  • 只有两种场景下众数填充不会带来明显负面影响:一是特征缺失率低于5%,且为完全随机缺失,填充带来的扰动可以忽略;二是使用同临床亚组的局部众数填充,且已经提前添加了缺失指示变量标记填充样本,此时填充值只是给模型提供一个基准参考,不会误导模型的特征学习方向。

内容的提问来源于stack exchange,提问作者顾家瑞

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.29 18:14:52