如何在GCP中使用AutoML解决罕见购买事件预测全为0的问题
GCP AutoML极端罕见二分类任务全输出0解决方案
你遇到的问题属于极端类别不平衡二分类场景的典型表现:1亿条数据中正样本(购买)仅34万条,占比只有0.03%0.04%,模型为了降低整体损失会直接全部预测占比更高的负样本,和特征组合的关联度很低,可通过以下方案调整:
- 调整训练集采样策略
保留全部正样本,对负样本做随机欠采样,仅抽取100万200万条负样本参与训练,将训练集的正负样本比例控制在1:301:100区间,避免用原始1:2500的极端比例喂给模型。注意验证集和测试集必须保留原始类别比例,不能做采样处理,才能反映模型的真实线上效果。 - 切换模型优化目标
AutoML默认优化分类准确率,完全不适用于不平衡场景,你需要在训练设置中将优化目标修改为PR AUC(精确率-召回率曲线下面积),该指标会更关注正样本的识别效果,避免模型为了整体准确率放弃正样本分类。 - 配置类别权重
在训练配置的类别权重设置项中,给正样本设置更高的分类权重,权重值可按「负样本数量/正样本数量」的比例设置,也就是给购买类设置2500左右的权重,放大模型对正样本分类错误的损失感知。 - 调整分类阈值
训练完成后不要使用默认的0.5分类阈值,可根据验证集的业务需求手动下调阈值,比如调整到0.01甚至更低,在可接受的误判率范围内尽可能捕获更多正样本。 - 补充交叉特征
现有5类基础特征的区分度可能不足,你可以基于原始特征做交叉衍生,比如「收入分位数×年龄区间」「居住区域×家庭规模」这类组合特征,喂给AutoML做特征选择,提升正样本的可区分性。
内容的提问来源于stack exchange,提问作者atsang01
相关产品推荐
相关产品推荐

