You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

薪资预测场景下含未读大学样本的分类缺失值填充方法

面向薪资预测场景的三个高教相关字段缺失值填充方案

首先明确核心前提:你这个数据集的缺失不是完全随机缺失,三个字段的缺失首先要按人群属性拆分处理,绝对不能上来就套统一填充规则,否则会直接抹掉“是否接受过大学教育”这个对薪资影响权重极高的特征。

第一步:先处理逻辑必然缺失的样本

已知有10000名员工从未接受过大学教育,这部分人三个字段的空值不是漏填,是根本不存在对应属性,直接统一填充明确分类值即可,不需要做任何统计推算:

  • 毕业院校字段填无高等教育经历
  • 大学所学专业字段填无高等教育经历
  • 大学毕业年份字段填无高等教育经历

别图省事填0、填全局众数,这类明确的分类值能让模型直接识别到“无大学学历”的群体特征,不会引入额外噪声。

第二步:处理有大学教育经历群体的真实缺失

剩下10000名接受过大学教育的员工的字段缺失,才是真正需要补全的漏填数据,填充优先级按以下顺序来,从低偏差到高偏差:

  • 优先用关联字段逻辑推算:如果数据集里包含年龄、工作年限、入职年份、最高学历层次这类字段,先做逻辑补全:
    • 毕业年份:用「出生年份+对应学历常规毕业年龄」推算,比如本科按22岁、大专按21岁、硕士按25岁算;或者用「入职年份-入职时已工作年限」推算,推算覆盖不到的样本再做分组填充。
    • 毕业院校、所学专业:不要用全局众数填,先按岗位序列、工作城市、薪资分箱、年龄层做分组,取对应分组内的众数填充——比如同是一线城市算法岗、工作3-5年、薪资区间30-40k的缺失样本,就填这个分组里出现频次最高的院校和专业,填充准确率比全局众数高很多。
  • 如果没有足够的关联字段做分组推算:直接给这部分缺失值单独设未知分类即可,不要硬塞具体值。很多缺失样本可能是境外院校、成人教育院校、非统招专业不在统计名录里,硬填一个常见院校/专业反而会给模型喂入错误特征,单独的未知分类会让树模型(薪资预测最常用的XGBoost、LightGBM都属于这类)自动学习这部分样本的薪资规律,不会引入人为偏差。

几个必须避开的坑

  • 绝对不要把两类人群的空值混在一起做填充:之前见过有人直接拿全量样本算院校众数给没上过大学的样本也填上,相当于直接把“无大学学历”这个强特征抹掉了,模型效果大幅下滑都是常事。
  • 填充时要保证字段间逻辑自洽:比如别给某样本填2000年毕业,院校填2010年才合并成立的新校名,也别给文科院校填核工程这类不存在的专业,逻辑矛盾的脏数据比空值对模型的伤害更大。
  • 如果你最终用的是树类模型,对于有大学经历群体的少量缺失,哪怕不做填充,让模型自动把缺失值作为单独分裂节点处理,效果也比乱填错误值好,不用为了“数据集没有空值”的强迫症硬凑数。

内容的提问来源于stack exchange,提问作者pkvv_8

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.01 04:48:17