上传gz格式数据集至Hugging Face Hub后无法加载求助
解决方案
- 问题根源:你的
train.gz文件命名不规范,datasets库无法识别压缩包内的原始数据格式(仅看到.gz后缀,不知道里面是JSON)。
修复步骤
- 重命名压缩文件:将
train.gz改为train.json.gz(保留原始JSON格式的后缀,加上.gz压缩标识),然后重新上传到Hugging Face仓库。 - 验证.gitattributes:确保仓库中的
.gitattributes包含对应规则(如果使用Git LFS管理大文件):*.json.gz filter=lfs diff=lfs merge=lfs -text - 重新加载数据集:使用原代码即可正常加载:
from datasets import load_dataset my_dataset = load_dataset('my_username/my_dataset')
备选方案(临时修复)
如果不想重新命名文件,可手动指定数据格式和文件路径:
from datasets import load_dataset my_dataset = load_dataset('json', data_files='https://huggingface.co/datasets/my_username/my_dataset/resolve/main/train.gz')
内容的提问来源于stack exchange,提问作者Penguin
相关产品推荐
相关产品推荐

