You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

多输出回归模型无法有效学习数据、准确率难以提升的技术求助

问题分析与优化建议

核心结论

从你描述的关键现象——无论模型容量如何提升都不发生过拟合、用159个特征预测单个特征准确率仍卡在50%-52%——可以直接判断:绝大多数目标特征与输入特征(甚至其他特征)之间不存在可被机器学习模型捕捉的统计关联,目标特征的取值随机性远大于输入能提供的有效信息。

验证与优化步骤

1. 定量验证特征关联性

先通过统计分析实锤特征间的独立性:

  • 计算互信息(Mutual Information):针对0-5的离散特征,互信息能精准衡量两个变量的依赖程度,若大部分目标特征与输入特征的互信息接近0,说明二者无关联。
  • 计算斯皮尔曼相关系数:适配排名类数据的单调关联分析,若系数绝对值普遍低于0.1,证明关联极弱。
  • 执行卡方独立性检验:若大部分检验无法拒绝“输入特征与目标特征独立”的假设,即可停止无效建模尝试。

2. 修正评价指标

当前用“四舍五入后对比准确率”的评估方式存在误导:

  • 先统计每个目标特征的取值分布,计算随机猜测基准准确率(比如若某特征70%取值为2,随机猜2就能拿到70%准确率),再对比模型结果,才能真实判断模型是否有效。
  • 改用适配任务的指标:比如针对离散排名的肯德尔秩相关系数、多输出场景的平均绝对误差(MAE),若将任务视为多分类,可使用交叉熵损失配合分类准确率。

3. 尝试适配离散排名数据的模型

普通ANN回归模型可能不匹配0-5排名特征的特性,试试这些方向:

  • 多输出分类模型:将每个目标特征视为6分类任务(0-5),输出层用Softmax,损失函数用交叉熵,更贴合离散取值的本质。
  • 序数回归模型:专门针对有序分类/排名任务的模型(如累积链接模型),能更好捕捉特征的顺序关系。
  • 树基多输出模型:XGBoost、LightGBM的多输出版本,对离散特征的关联性捕捉更直接,还能输出特征重要性,帮你筛选出少数可能有预测价值的特征。

4. 重新审视任务合理性

若验证后确认特征间无关联:

  • 核对任务要求:是否存在理解偏差?比如是否只需预测特定特征子集,而非全部160个?或者输入的30个特征是否选取得当?
  • 评估数据价值:如果特征本身无关联,除非引入外部补充数据,否则无法提升预测效果,需考虑调整任务目标。

内容的提问来源于stack exchange,提问作者HrayrM

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.17 06:11:16