You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

求适用于89行小样本、准确率≥80%的ML回归预测模型

针对小数据集的回归模型推荐与优化方案

适合小数据集的回归模型

  • K近邻回归(KNN Regression):基于实例的模型,无需复杂训练逻辑,依赖相似样本的标签值输出预测结果,在小数据集且特征与标签关联性较强的场景下表现稳定。需注意调整K值(建议从3到10逐一尝试),同时对特征做标准化处理,避免数值范围差异干扰距离计算逻辑。
  • 支持向量回归(SVR):尤其是线性核或RBF核版本,小数据集下泛化能力优于多数复杂模型,能较好处理非线性关系。可通过调整正则化参数C、核参数gamma优化效果,特征标准化是必要前提。
  • 贝叶斯线性回归:引入先验概率约束,能有效缓解小数据集的过拟合问题,输出结果还附带不确定性估计,适合数据量有限的回归任务。

现有模型效果差的优化方向

你之前尝试的模型并非完全不适配小数据,大概率是未做针对性调整:

  • 线性回归:若特征与标签存在非线性关系,纯线性模型自然失效。可尝试添加多项式特征(如Count19的平方、Count19*Count20交互项),将线性模型扩展为多项式回归。
  • 决策树/随机森林:小数据下极易过拟合,决策树需限制max_depth(最大深度)、min_samples_split(最小样本分割数);随机森林要减少n_estimators(树的数量)、降低单棵树复杂度,避免因特征过少导致模型结构失衡。
  • LSTM:89行数据完全无法支撑深度学习模型训练,LSTM需要大量时序数据才能学习规律,小数据场景下直接放弃这类模型即可。

关键预处理与验证步骤

  • 特征工程:仅有的2个特征可衍生新变量,比如两年数值的差值(Count20 - Count19)、比值(Count20/Count19)、均值等,这类衍生特征可能捕捉到更有效的预测规律。
  • 交叉验证:小数据集禁止使用简单的train-test拆分,必须采用K折交叉验证(推荐5折或10折),以此消除单次划分的随机性误差,更准确评估模型真实性能。
  • 评估指标:回归任务不要仅关注RMSE/MSE,同时参考R²分数(越接近1效果越好),结合业务场景判断预测偏差是否可接受——有时RMSE偏高但整体趋势符合需求,也能满足准确率要求。

额外建议

若以上方法仍无改善,先验证特征与标签的关联性:计算特征与标签的皮尔逊相关系数,或用箱线图观察特征不同区间下的标签分布差异,确认特征是否具备预测价值。若关联性极低,优先考虑补充有效特征,而非纠结模型选择。

内容的提问来源于stack exchange,提问作者IounmS

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 15:52:39