You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Simpletransformers训练与评估时未使用全部数据的问题咨询

问题原因与解决方法

1. 训练仅使用8条样本的核心原因

你注释了reprocess_input_data参数,SimpleTransformers默认会复用历史处理过的数据集缓存,如果你此前运行过只有8条样本的测试任务,旧缓存没有被清理的情况下,后续训练会直接读取缓存的8条数据,不会处理你新传入的3890条全量数据集。

2. 修复步骤

  • 第一步:取消train_args中reprocess_input_data参数的注释,设置为True,强制框架重新处理当前传入的训练集:
train_args ={
    "reprocess_input_data": True,
    "overwrite_output_dir": True,
    "fp16":False,
    "num_train_epochs": 2
}
  • 第二步:训练前打印训练集长度确认数据无误:
# 替换为你的训练集变量名
print(len(train_df))
  • 第三步:启动训练后查看控制台输出的Num examples字段,该数值即为实际参与训练的样本总数,确认是否为3890即可。

3. 进度条显示0%的问题

该问题属于Jupyter/Colab等 notebook 环境的组件依赖缺失,和模型训练逻辑无关:

  • 你评估阶段输出结果长度为1945,说明评估逻辑已经正常执行完成,只是进度条没有正确渲染
  • 如需修复进度条显示,执行pip install ipywidgets后重启notebook内核,重新运行代码即可正常显示进度。

可选检查项

如果执行上述步骤后还是存在样本数不对的问题,检查训练集DataFrame:

  • 列名必须严格为小写的sentence和label,不要出现拼写、大小写错误
  • 检查两列是否存在空值,执行print(train_df.isna().sum())确认没有空数据

内容的提问来源于stack exchange,提问作者IS92

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 19:15:03