微调tinkoff-ai/ruDialoGPT-medium模型,数据集应采用何种格式?
适配ruDialoGPT-medium的微调数据集格式方案
你的问题核心是当前数据集格式和模型预训练时的对话结构不匹配,模型无法正确识别对话角色和轮次,导致生成效果拉胯。按照模型要求,数据集需要调整成以下格式:
正确的单轮对话样本格式
每个样本要把对话内容用模型指定的角色标记拼接成完整字符串,示例如下:
{"sample": "@@ПЕРВЫЙ@@ Я ищу бесплатные онлайн-курсы по бухгалтерскому учету. @@ВТОРОЙ@@ В сети есть ряд бесплатных онлайн-курсов по бухгалтерскому учету, таких как Coursera и edX. Эти курсы предлагают вводные занятия по бухгалтерскому учету продвинутого уровня, которые могут помочь вам изучить основы бухгалтерского учета и финансового управления. Вы также можете заглянуть в местные общественные колледжи или центры обучения взрослых в вашем районе для получения более специализированных курсов по бухгалтерскому учету."}
多轮对话样本格式(如果需要)
如果是多轮对话,保持角色标记交替出现,连贯拼接所有轮次内容:
{"sample": "@@ПЕРВЫЙ@@ привет @@ВТОРОЙ@@ привет @@ПЕРВЫЙ@@ как дела? @@ВТОРОЙ@@ Все хорошо, а у тебя? @@ПЕРВЫЙ@@ Нормально, спасибо. Я ищу бесплатные курсы по бухгалтерскому учету. @@ВТОРОЙ@@ В сети есть ряд бесплатных онлайн-курсов по бухгалтерскому учету, таких как Coursera и edX..."}
关键注意事项
- 必须严格使用模型指定的
@@ПЕРВЫЙ@@(第一发言者)和@@ВТОРОЙ@@(第二发言者)标记,不能自定义其他标识 - 对话内容要合并成单个字符串,不要拆分成数组形式
- 标记和内容之间要保留空格,和模型给出的示例格式完全对齐
- 多轮对话要保证角色交替的完整性,不能中途遗漏角色标记
内容的提问来源于stack exchange,提问作者Ubuty_programmist_7
相关产品推荐
相关产品推荐

