You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何独热编码(OHE)在此AutoKeras分类任务中准确率更低?

独热编码标签导致AutoKeras准确率骤降的原因分析
  • 损失函数与任务类型不匹配
    AutoKeras识别到独热编码标签时,默认会采用分类交叉熵损失函数,但如果你的模型输出层未对应设置softmax激活,或者独热编码本身存在格式问题(比如标签列顺序错误、包含无效值),会导致损失计算逻辑混乱,模型无法有效学习特征与标签的关联。而整数标签会触发稀疏分类交叉熵损失,这种损失不需要手动做独热编码,对标签格式容错性更高,更适配AutoKeras默认的分类模型结构。

  • AutoKeras模型搜索逻辑的差异
    AutoKeras会根据输入标签的类型自动调整候选模型结构的搜索方向。当输入是独热编码时,它可能会尝试一些适配多维度标签的复杂结构(比如额外的全连接层),反而干扰了模型对核心特征(邻域计数、氢键计数等)的学习;而整数标签会引导AutoKeras搜索更适合单标签分类的轻量化结构,刚好匹配你的数据特性,从而得到精度更高的模型。

  • 分块加载时的独热编码数据问题
    你采用分块加载.npy文件的方式,独热编码是二维数据(样本数×3),在分块合并过程中更容易出现维度错位、数据拼接错误等问题,导致模型接收的标签信号混乱。而整数标签是一维数据,分块加载和合并时出错概率低,模型能稳定获取正确的标签信息。

  • 标签分布与独热编码的适配性问题
    如果你的三类标签分布不均衡,独热编码会让分类交叉熵对每个类别单独计算损失,放大少数类的损失权重,导致模型偏向多数类,测试时准确率骤降;而稀疏分类交叉熵针对单个标签计算损失,更适合不均衡数据集的学习,能让模型更好地捕捉类别边界。

内容的提问来源于stack exchange,提问作者user366312

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.04 12:32:07