You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

训练集与测试集对重要变量缺失值采用不同填补方式是否会引入偏差

结论

这种差异化填补逻辑必然会引入偏差,属于不可取的错误处理方案,核心问题出在两个层面:

  • 数据泄露:训练集填补X时引入了目标变量Y的信息,相当于给后续要用来预测Y的特征X,提前注入了Y的真实值关联信息,会导致训练阶段的模型效果被严重高估,完全无法反映真实的泛化能力。
  • 特征分布不一致:训练集的X填补值携带Y的信息,测试集的X填补值没有Y的信息,两个数据集的X特征分布存在系统性差异,后续训练好的模型在测试集上预测时,会因为输入特征分布偏移出现效果暴跌的问题。
正确处理方案

所有填补规则必须在训练集和测试集上完全对齐,全程不能引入Y的信息,也不能泄露测试集的数据:

  • 仅使用训练集的非缺失X样本,以除Y之外的其他特征作为自变量训练X的线性回归填补模型
  • 用上述训练好的同一个填补模型,分别处理训练集的X缺失值、测试集的X缺失值,保证两个数据集的X填补逻辑完全一致
  • 如果想要进一步提升填补精度,可以选择多重插补方案,但同样需要严格遵循「只用训练集拟合插补器、训练测试插补规则统一」的要求。

额外提醒:不要为了提升填补精度合并训练集和测试集来训练插补模型,这种操作同样属于数据泄露,会导致后续模型泛化效果失真。

内容的提问来源于stack exchange,提问作者YOUZI

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 10:45:05