基于OpenAI大语言模型的多类别商品分类:分类判定与概率输出对比
商品多类别分类的LLM方案选型与参考依据
现有方案对比
- 方案1:逐类别判定:针对每个类别单独询问商品是否归属,循环完成全类别判定。优势是逻辑简单、prompt设计门槛低、结果直观;缺点是交互次数多、效率偏低,无法直接获取类别间的概率差异。
- 方案2:直接获取类别概率:一次性获取商品属于所有类别的概率值。核心优势是支持后续调整预测阈值,可针对性实现特定类别的过分类(降低阈值提升召回)或欠分类(提高阈值提升精准度),更适配业务灵活需求。
RLHF模型概率预测能力的争议点
有观点指出,经RLHF训练的OpenAI对话模型(如gpt-3.5-turbo、gpt-4),相比text-davinci-003这类文本补全模型,概率预测能力更弱。核心原因是RLHF训练的目标是让模型输出更贴合人类偏好的自然响应,而人类本身不擅长精准的概率估算,因此模型会牺牲部分概率校准精度来对齐人类思维模式。
参考文献与基线方案
相关研究依据
- OpenAI技术文档提及:RLHF优化了模型的人类对齐度,但在概率输出的校准性上,自回归补全模型(如text-davinci-003)表现更稳定,因为这类模型的训练目标更侧重预测下一个token的概率分布,天然保留了概率输出的原始特性。
- 部分学术研究显示:对话类LLM的概率输出常存在过度自信或分布偏移问题,而补全类模型的概率输出更接近真实的类别分布。
基线方案设计
- 方案1基线:使用标准化prompt模板,例如:
商品【{商品描述}】是否属于{类别名称}?请仅回答“是”或“否”,遍历所有类别完成判定,统计最终分类结果。 - 方案2基线:设计结构化输出prompt,例如:
请给出商品【{商品描述}】属于以下类别的概率,格式为“类别1:X%,类别2:Y%,...”:{类别列表},同时可测试不同表述(如要求输出小数概率)对结果的影响。 - 概率校准补充方案:若采用RLHF模型做概率预测,可先用少量标注数据建立输出概率与真实标签的映射关系,通过线性缩放或Platt缩放法校准概率,提升精度。
测试建议
计划开展的100组测试可从以下维度设计:
- 选取覆盖不同品类、复杂度的商品样本,确保测试的代表性;
- 对比方案1和方案2的分类准确率、结果一致性;
- 针对方案2,测试调整阈值后特定类别的召回率、精准度变化;
- 对比gpt-3.5-turbo/gpt-4与text-davinci-003的概率输出差异,验证RLHF模型概率能力的争议点。
内容的提问来源于stack exchange,提问作者FAD
相关产品推荐
相关产品推荐

