TensorFlow Datasets翻译场景:如何正确使用WMT14数据集手动下载功能?
关于manual download的定义
官方提到的「manual download」确实是要求你自行下载对应数据集文件,再放入TFDS指定目录,但不是直接放到根目录的tensorflow_datasets文件夹,需要放到该目录下的downloads/manual子目录中,且保留原始未解压的压缩包格式。
放置文件后仍自动下载的常见原因
- 路径不匹配:默认TFDS根目录为家目录下的
~/tensorflow_datasets,如果你调用tfds.load时指定了自定义data_dir参数,需要将手动下载的文件放到自定义data_dir/downloads/manual路径下,而非默认路径。 - 文件名不匹配:TFDS对WMT14 de-en数据集的各个压缩包文件名有严格的预设要求,如果你下载的文件命名和预期不符,会被判定为不存在,触发自动下载。
- 提前解压了文件:TFDS仅识别原始未解压的压缩包,提前解压后的文件不会被识别。
- 文件校验不通过:如果你下载的文件版本错误、下载过程中损坏,和TFDS内置的MD5校验值不一致,也会被判定为无效文件,触发重新下载。
排查方法
你可以运行以下代码查看当前数据集要求的手动下载文件明细、以及预期的存放路径,按要求调整即可:
import tensorflow_datasets as tfds builder = tfds.builder('wmt14_translate/de-en') # 输出官方要求的手动下载文件说明 print(builder.MANUAL_DOWNLOAD_INSTRUCTIONS) # 输出当前环境下预期的manual目录路径 print(builder._manual_dir)
调整完成后再运行你原有的加载代码,就会跳过下载环节,直接启动本地数据预处理流程。
内容的提问来源于stack exchange,提问作者Dametime
相关产品推荐
相关产品推荐

