完成数据预处理后筛选优质候选模型应使用哪类数据集
候选模型筛选的数据集选择方案
核心结论:优先使用完成全量预处理(清洗、特征选择、特征工程)的数据集做候选模型初筛,仅在需要验证特征工程收益、设置效果基准线的场景下,额外搭配仅做了缩放、编码的基础处理数据集使用,完全不推荐仅用基础处理数据集做筛选。
具体判断逻辑
1. 为什么优先选全量预处理后的数据集
你之前做特征选择、特征工程的核心目的就是过滤无效噪声、强化数据中的有效信号,用这份数据集跑出来的模型效果最贴近最终上线的真实表现,可以在初筛阶段就快速排除掉对有效特征不敏感、泛化能力差的模型,避免后续做无用的调参优化。
反过来如果你用没做特征工程、特征筛选的基础数据集跑测试,大量无关噪声特征可能会干扰模型效果判断:比如树模型抗噪能力强效果表现正常,线性模型直接被噪声带偏表现极差,你很可能会误判线性模型不匹配当前任务,直接筛掉本来可用的方案。
2. 什么情况下需要同时用两类数据集
只有两种场景需要你同时跑两份数据集的对照:
- 你不确定当前做的特征工程是不是引入了人为偏差,可以用基础处理数据集的效果做基准:如果全量预处理后的数据集在所有候选模型上的效果都优于基准值,说明你的特征处理方向是对的;如果效果反而下降,就需要回头排查特征衍生、筛选的逻辑是不是出了问题。
- 你后续计划做迭代式的特征优化,可以先把基础处理数据集的跑出来的模型效果作为基准线,后续每迭代一个版本的特征数据集,都和基准线比效果,能直接量化每次特征优化的收益。
3. 为什么不推荐仅用基础处理数据集
相当于完全浪费了你前面做数据预处理的全部工作量,而且初筛出来的模型效果和最终上线的表现会有极大偏差,后续你换用全量预处理数据集后还得重新做一轮筛选,纯纯浪费时间。
内容的提问来源于stack exchange,提问作者rober_dinero
相关产品推荐
相关产品推荐

