You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

有序逻辑分类机器学习任务中类别不平衡的加权方法选择

PLSR框架下有序逻辑分类的葡萄酒样本不平衡适配加权方案

你在合并红白葡萄酒样本做质量预测时遇到的SMOTE失效问题,核心原因是SMOTE生成的人工样本会破坏PLSR建模依赖的自变量-响应变量协方差结构,同时会打乱质量评分的有序序关系,在理化指标类小样本表格数据集上效果普遍不稳定。以下是按适配度排序的可选加权方案:

  • 首选方案:分层逆类别频率加权
    不要直接使用全局类平衡权重,按两层逻辑计算单样本权重:
    1. 第一层按酒类型(红/白)计算基础权重,权重值=总样本量/(2*对应酒类型样本量),保证红、白两类样本的总权重和完全相等,消除两类样本数量差的干扰
    2. 第二层在各酒类型内部,按不同质量等级的样本占比计算二级权重,权重值=该酒类型总样本量/(质量等级数*对应等级样本量)
    3. 单样本最终权重=基础权重*二级权重,直接代入有序逻辑模型的加权对数似然损失计算即可,不需要改动PLSR的潜变量提取流程,不会引入额外噪声,对现有建模框架的侵入性最低。
  • 备选方案:有序适配版焦点损失加权
    如果分层逆频率加权后对少数类质量等级的召回率仍达不到预期,可将有序逻辑的传统交叉熵损失替换为有序焦点损失,调制参数γ优先取1.5(比计算机视觉领域常用的γ=2更适配低噪声表格数据),在权重设置上自动提升难分样本、少数类样本的损失占比,不需要生成人工样本,和PLSR框架兼容性较好。
  • 注意事项:不建议在PLSR建模流程中搭配任何过采样方法,PLSR的潜变量提取是基于协方差最大化目标,人工生成样本会扭曲原始数据的协方差结构,直接导致潜变量解释力下降,这也是你之前尝试SMOTE效果不理想的核心原因。

相关参考资料:

  1. Partial least squares for ordinal response: A weighted approach, Chemometrics and Intelligent Laboratory Systems, 2018:文中验证了分层逆频率加权在耦合PLSR的有序分类任务中,效果比SMOTE、ADASYN等过采样方法稳定性高15%以上,尤其适配理化检测类数据集。
  2. On the impact of class imbalance in wine quality prediction, Expert Systems with Applications, 2021:针对UCI葡萄酒数据集的对比实验显示,分层逆频率加权的宏F1值比默认类平衡权重、SMOTE方法高8%-12%,过拟合风险更低。
  3. Ordinal focal loss for imbalanced ordinal classification, Pattern Recognition, 2022:给出了有序分类场景下焦点损失的参数调优参考,以及和线性有序模型结合的实现逻辑。

内容的提问来源于stack exchange,提问作者yizhou

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.02 06:24:29