Hugging Face load_dataset加载OSCAR数据集耗时2小时是否正常?
执行操作说明
你当前卡在load_dataset阶段时,程序正在依次执行以下操作:
- 下载9.74GiB的
oscar/unshuffled_deduplicated_fa原始压缩数据集 - 解压原始压缩包得到37.24GiB的原始语料文件
- 校验语料文件完整性
- 将原始语料转换为Hugging Face Datasets库默认的Arrow列式存储格式,写入本地缓存目录,方便后续快速随机读取
耗时过长是否正常
2小时的运行时长属于公共计算环境下的合理波动范围,不属于异常错误:
- Google Colab公共实例的磁盘IO、下载带宽本身波动极大,高峰时段会被严重限流,37GiB级别的数据集做格式转换本身就需要消耗大量CPU和IO资源
- 你可以查看Colab界面右上角的资源监控面板,如果磁盘还有持续的读写流量,说明进程仍在正常运行,没有卡死
是否需要中断重跑
分两种情况判断:
- 若磁盘读写已经完全静止超过15分钟,说明进程已经卡死,可以直接中断重新执行。Datasets库自带断点续存逻辑,已经下载和处理完成的缓存文件不会重复生成,下次启动会自动从断点处继续运行。
- 若磁盘还有持续读写,建议再等待1~2小时,若仍未完成再中断。后续你可以在
load_dataset方法中添加streaming=True参数,无需下载全量数据集到本地,直接流式读取语料训练分词器,能省掉几十GiB的下载和格式转换时间,完全满足当前训练分词器的需求。
内容的提问来源于stack exchange,提问作者Ahmad
相关产品推荐
相关产品推荐

