全分类特征下连续值预测建模相关技术问题咨询
问题场景
建模任务为基于纯分类特征预测2列连续目标值H1、H2,核心目标是筛选出使两个目标预测效果最优的特征组合。数据集存在分类特征类别分布不均问题,部分稀有类别仅出现1次;已尝试随机森林(RF)、K近邻回归(KNN)、支持向量回归(SVR)三类模型,当前RMSE得分偏高。
相关参考材料:
- 数据集样例:

- 分类列类别频次统计:

针对性解答
1. 分类特征类别不平衡的影响与解决方案
分类特征的类别分布不均(尤其是存在大量仅出现1次的稀有类别)会显著拉低预测效果:
- 对树类模型:稀有类别对应的切分节点覆盖样本量极少,生成的切分规则泛化性极差,极易造成过拟合,直接推高测试集误差
- 对KNN、SVR等距离敏感模型:若采用独热编码,稀有类别对应的维度会引入无意义的距离计算干扰,破坏样本间相似度计算的准确性
可按以下优先级处理:
- 先做类别归并:将出现频次低于阈值(通常取总样本量的0.5%~1%,或直接把出现次数<3的类别)统一合并为
other类,从根源上减少无意义稀有类别的干扰 - 若部分稀有类别对应业务层面的重要分组,不适合直接归并,采用*加入平滑项的目标编码(Target Encoding)*替代独热编码,编码时必须使用交叉验证框架生成编码值,避免标签泄露
- 注意:不要使用SMOTE等针对分类任务标签不平衡设计的重采样方法,这类方法在回归任务的特征侧使用只会引入额外噪声。
2. 最优特征组合的确定方法
完全不需要遍历所有特征组合,当特征数量超过10个时,遍历所有组合的计算量呈指数级增长,没有落地可行性。
推荐的筛选流程:
- 初筛阶段:通过互信息、方差分析F值先过滤掉和目标无统计关联的特征,将候选特征池规模压缩到原有规模的1/3以内
- 精筛阶段:使用结合交叉验证的*递归特征消除(RFE)*或序列特征选择(SFS):前者从全特征开始逐轮剔除贡献最低的特征,后者从空集开始逐轮加入贡献最高的特征,记录不同特征数量下的交叉验证RMSE,取RMSE最低对应的特征集合即可。特征总数在20个以内时优先选SFS,稳定性优于RFE
- 由于存在H1、H2两个预测目标,筛选时不要为两个目标单独筛选特征集,建议使用多输出模型开展特征选择,以两个目标RMSE的加权值(可按业务重要性分配权重)作为评估指标,取综合表现最优的特征组合。
3. 分类特征与连续目标的关联判定方法
当前采用的「独热编码后计算皮尔逊相关系数绘制热力图」的方法存在明显缺陷:独热拆分出的稀有类别列相关性计算结果可靠性极低,且皮尔逊系数只能捕捉线性关联,会遗漏大量非线性关联关系。
更准确的判定方案:
- 单特征关联强度初筛:用方差分析(ANOVA)F值衡量特征与目标的线性关联强度,用互信息(Mutual Information)回归得分衡量非线性关联强度,两个指标结合评估,互信息得分低于0.01的特征可直接过滤
- 排除共线性干扰的精准评估:计算特征的置换重要性(Permutation Importance)——在训练好的模型上随机打乱某列特征的取值,观测模型RMSE的上升幅度,幅度越高说明该特征的预测贡献越大。该方法不受编码方式、模型类型限制,结果稳定性高
- 直观验证环节:对每个分类特征绘制分组箱线图,观测不同类别下H1/H2的分布差异,分布差异越显著则特征与目标的关联越强。
4. 适配该场景的机器学习模型
此前尝试的三类模型均为基础选项,在纯分类特征的回归场景下,优先尝试以下鲁棒性更强、效果上限更高的模型:
- 首推CatBoost:原生支持分类特征输入,无需提前做独热编码,内置稀有类别自动处理、平滑目标编码逻辑,对类别分布不均的鲁棒性远高于普通随机森林,且原生支持多输出回归,可同时拟合H1、H2两个目标,调参成本低
- 次选LightGBM:建模时将分类特征指定为
category类型,适当调大min_data_in_leaf参数,避免模型在稀有类别上过拟合 - 若追求强可解释性,可在对分类特征做平滑目标编码后,使用带正则项的广义加性模型(GAM)
- 不建议在该场景下使用普通线性回归、原生SVR:这类模型对高维稀疏的独热编码特征适配性差;KNN对类别噪声过于敏感,效果上限较低
- 注意:所有模型验证环节请使用分组交叉验证,不要使用简单随机拆分:存在稀有类别时,随机拆分很可能导致部分类别仅出现在训练集或测试集,得到的RMSE验证结果完全不具备参考性。
5. 同场景学术文献检索关键词
可组合以下关键词检索,覆盖方法、场景两类维度:
- 方法类关键词:
categorical feature regression、rare category handling for regression、multi-target regression feature selection、smoothed target encoding - 场景类关键词:
all-categorical-input regression、imbalanced categorical features regression - 具体方案参考类关键词:
CatBoost categorical regression、permutation importance feature screening
内容的提问来源于stack exchange,提问作者Muhammad M
相关产品推荐
相关产品推荐

