You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Hugging Face load_dataset加载OSCAR数据集耗时2小时是否正常?

执行操作说明

你当前卡在load_dataset阶段时,程序正在依次执行以下操作:

  • 下载9.74GiB的oscar/unshuffled_deduplicated_fa原始压缩数据集
  • 解压原始压缩包得到37.24GiB的原始语料文件
  • 校验语料文件完整性
  • 将原始语料转换为Hugging Face Datasets库默认的Arrow列式存储格式,写入本地缓存目录,方便后续快速随机读取
耗时过长是否正常

2小时的运行时长属于公共计算环境下的合理波动范围,不属于异常错误:

  • Google Colab公共实例的磁盘IO、下载带宽本身波动极大,高峰时段会被严重限流,37GiB级别的数据集做格式转换本身就需要消耗大量CPU和IO资源
  • 你可以查看Colab界面右上角的资源监控面板,如果磁盘还有持续的读写流量,说明进程仍在正常运行,没有卡死
是否需要中断重跑

分两种情况判断:

  • 若磁盘读写已经完全静止超过15分钟,说明进程已经卡死,可以直接中断重新执行。Datasets库自带断点续存逻辑,已经下载和处理完成的缓存文件不会重复生成,下次启动会自动从断点处继续运行。
  • 若磁盘还有持续读写,建议再等待1~2小时,若仍未完成再中断。后续你可以在load_dataset方法中添加streaming=True参数,无需下载全量数据集到本地,直接流式读取语料训练分词器,能省掉几十GiB的下载和格式转换时间,完全满足当前训练分词器的需求。

内容的提问来源于stack exchange,提问作者Ahmad

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 21:18:01