You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Vertex AI AutoML分类变量处理方法咨询(含高基数场景)

Vertex AI AutoML 分类变量处理细节(含高基数场景)

普通基数分类变量处理

  • 针对低、中等基数的分类字段(类别数量较少),AutoML会自动选择适配的编码方式:
    • 分类任务中优先采用目标编码(利用目标变量的统计信息编码类别,提升模型对类别与目标关联的捕捉能力);
    • 部分场景下也会自动切换为独热编码,无需用户手动配置。

高基数分类变量处理逻辑

对于用户ID、商品SKU这类类别数量极大的高基数字段,AutoML的处理流程如下:

  1. 先将每个类别名称映射为唯一整数索引(通过字典查找实现,避免字符串直接参与计算);
  2. 基于这些索引生成可训练的低维嵌入向量——这既不是会引发维度爆炸的独热编码,也不是固定规则的目标编码,而是模型在训练过程中自动学习得到的稠密向量:
    • 训练时,系统会根据数据分布和任务目标(分类/回归),自动优化嵌入向量的维度和数值,让语义或行为相似的类别在嵌入空间中距离更近;
    • 这种方式既解决了高基数带来的维度灾难问题,又能保留类别间的潜在关联信息。

与BQML的差异

不同于BQML早期仅采用独热编码处理分类变量,Vertex AI AutoML针对高基数场景的嵌入是端到端训练的一部分,全程无需用户手动干预编码规则或嵌入参数,系统会自动完成优化。

内容的提问来源于stack exchange,提问作者Michael Joyce

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 20:02:07