You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

微调tinkoff-ai/ruDialoGPT-medium模型,数据集应采用何种格式?

适配ruDialoGPT-medium的微调数据集格式方案

你的问题核心是当前数据集格式和模型预训练时的对话结构不匹配,模型无法正确识别对话角色和轮次,导致生成效果拉胯。按照模型要求,数据集需要调整成以下格式:

正确的单轮对话样本格式

每个样本要把对话内容用模型指定的角色标记拼接成完整字符串,示例如下:

{"sample": "@@ПЕРВЫЙ@@ Я ищу бесплатные онлайн-курсы по бухгалтерскому учету. @@ВТОРОЙ@@ В сети есть ряд бесплатных онлайн-курсов по бухгалтерскому учету, таких как Coursera и edX. Эти курсы предлагают вводные занятия по бухгалтерскому учету продвинутого уровня, которые могут помочь вам изучить основы бухгалтерского учета и финансового управления. Вы также можете заглянуть в местные общественные колледжи или центры обучения взрослых в вашем районе для получения более специализированных курсов по бухгалтерскому учету."}

多轮对话样本格式(如果需要)

如果是多轮对话,保持角色标记交替出现,连贯拼接所有轮次内容:

{"sample": "@@ПЕРВЫЙ@@ привет @@ВТОРОЙ@@ привет @@ПЕРВЫЙ@@ как дела? @@ВТОРОЙ@@ Все хорошо, а у тебя? @@ПЕРВЫЙ@@ Нормально, спасибо. Я ищу бесплатные курсы по бухгалтерскому учету. @@ВТОРОЙ@@ В сети есть ряд бесплатных онлайн-курсов по бухгалтерскому учету, таких как Coursera и edX..."}

关键注意事项

  • 必须严格使用模型指定的@@ПЕРВЫЙ@@(第一发言者)和@@ВТОРОЙ@@(第二发言者)标记,不能自定义其他标识
  • 对话内容要合并成单个字符串,不要拆分成数组形式
  • 标记和内容之间要保留空格,和模型给出的示例格式完全对齐
  • 多轮对话要保证角色交替的完整性,不能中途遗漏角色标记

内容的提问来源于stack exchange,提问作者Ubuty_programmist_7

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 15:38:12