Databricks读取GCS中.csv.gz文件遇FAILED_READ_FILE错误求助
解决Databricks读取GCS压缩CSV文件时的FAILED_READ_FILE错误
检查路径正确性
- Unity Catalog卷的完整路径格式应为
dbfs:/Volumes/<catalog>/<schema>/<volume>/<file-path>,你当前使用的dbfs:/Volumes/file.csv.gz缺少了目录层级(catalog、schema、volume名称),这是常见的路径错误。 - 可通过Databricks UI的Volumes页面确认完整路径,或执行
dbutils.fs.ls("dbfs:/Volumes/")逐层查找目标文件。
显式指定压缩格式
Spark有时无法自动识别.gz压缩格式,需手动指定压缩选项:
df = spark.read.option("header", "true") \ .option("compression", "gzip") \ .csv("dbfs:/Volumes/<catalog>/<schema>/<volume>/file.csv.gz")
验证权限与挂载状态
- 确认当前Databricks用户对该外部卷拥有
READ或SELECT权限(在Unity Catalog权限设置中检查)。 - 执行
dbutils.fs.ls("<完整卷路径>")测试挂载状态:若能列出文件则挂载正常,否则需重新挂载或检查GCS凭证配置。
确认文件完整性
- 将文件下载到本地解压,验证CSV内容是否正常;或在Databricks中执行
dbutils.fs.head("<完整文件路径>")查看文件头部,确认文件未损坏。
内容的提问来源于stack exchange,提问作者Tony
相关产品推荐
相关产品推荐

