You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在GCP中使用AutoML解决罕见购买事件预测全为0的问题

GCP AutoML极端罕见二分类任务全输出0解决方案

你遇到的问题属于极端类别不平衡二分类场景的典型表现:1亿条数据中正样本(购买)仅34万条,占比只有0.03%0.04%,模型为了降低整体损失会直接全部预测占比更高的负样本,和特征组合的关联度很低,可通过以下方案调整:

  • 调整训练集采样策略
    保留全部正样本,对负样本做随机欠采样,仅抽取100万200万条负样本参与训练,将训练集的正负样本比例控制在1:301:100区间,避免用原始1:2500的极端比例喂给模型。注意验证集和测试集必须保留原始类别比例,不能做采样处理,才能反映模型的真实线上效果。
  • 切换模型优化目标
    AutoML默认优化分类准确率,完全不适用于不平衡场景,你需要在训练设置中将优化目标修改为PR AUC(精确率-召回率曲线下面积),该指标会更关注正样本的识别效果,避免模型为了整体准确率放弃正样本分类。
  • 配置类别权重
    在训练配置的类别权重设置项中,给正样本设置更高的分类权重,权重值可按「负样本数量/正样本数量」的比例设置,也就是给购买类设置2500左右的权重,放大模型对正样本分类错误的损失感知。
  • 调整分类阈值
    训练完成后不要使用默认的0.5分类阈值,可根据验证集的业务需求手动下调阈值,比如调整到0.01甚至更低,在可接受的误判率范围内尽可能捕获更多正样本。
  • 补充交叉特征
    现有5类基础特征的区分度可能不足,你可以基于原始特征做交叉衍生,比如「收入分位数×年龄区间」「居住区域×家庭规模」这类组合特征,喂给AutoML做特征选择,提升正样本的可区分性。

内容的提问来源于stack exchange,提问作者atsang01

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 04:48:03