You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于OpenAI大语言模型的多类别商品分类:分类判定与概率输出对比

商品多类别分类的LLM方案选型与参考依据

现有方案对比

  • 方案1:逐类别判定:针对每个类别单独询问商品是否归属,循环完成全类别判定。优势是逻辑简单、prompt设计门槛低、结果直观;缺点是交互次数多、效率偏低,无法直接获取类别间的概率差异。
  • 方案2:直接获取类别概率:一次性获取商品属于所有类别的概率值。核心优势是支持后续调整预测阈值,可针对性实现特定类别的过分类(降低阈值提升召回)或欠分类(提高阈值提升精准度),更适配业务灵活需求。

RLHF模型概率预测能力的争议点

有观点指出,经RLHF训练的OpenAI对话模型(如gpt-3.5-turbo、gpt-4),相比text-davinci-003这类文本补全模型,概率预测能力更弱。核心原因是RLHF训练的目标是让模型输出更贴合人类偏好的自然响应,而人类本身不擅长精准的概率估算,因此模型会牺牲部分概率校准精度来对齐人类思维模式。

参考文献与基线方案

相关研究依据

  • OpenAI技术文档提及:RLHF优化了模型的人类对齐度,但在概率输出的校准性上,自回归补全模型(如text-davinci-003)表现更稳定,因为这类模型的训练目标更侧重预测下一个token的概率分布,天然保留了概率输出的原始特性。
  • 部分学术研究显示:对话类LLM的概率输出常存在过度自信或分布偏移问题,而补全类模型的概率输出更接近真实的类别分布。

基线方案设计

  • 方案1基线:使用标准化prompt模板,例如:商品【{商品描述}】是否属于{类别名称}?请仅回答“是”或“否”,遍历所有类别完成判定,统计最终分类结果。
  • 方案2基线:设计结构化输出prompt,例如:请给出商品【{商品描述}】属于以下类别的概率,格式为“类别1:X%,类别2:Y%,...”:{类别列表},同时可测试不同表述(如要求输出小数概率)对结果的影响。
  • 概率校准补充方案:若采用RLHF模型做概率预测,可先用少量标注数据建立输出概率与真实标签的映射关系,通过线性缩放或Platt缩放法校准概率,提升精度。

测试建议

计划开展的100组测试可从以下维度设计:

  • 选取覆盖不同品类、复杂度的商品样本,确保测试的代表性;
  • 对比方案1和方案2的分类准确率、结果一致性;
  • 针对方案2,测试调整阈值后特定类别的召回率、精准度变化;
  • 对比gpt-3.5-turbo/gpt-4与text-davinci-003的概率输出差异,验证RLHF模型概率能力的争议点。

内容的提问来源于stack exchange,提问作者FAD

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.18 19:22:55