PySpark读取GCS Bucket文件随机出现403 Forbidden问题求助
使用PySpark读取Google Cloud Storage(GCS)中的Parquet文件时,遇到403权限禁止错误:
Caused by: com.amazonaws.services.s3.model.AmazonS3Exception: Forbidden (Service: Amazon S3; Status Code: 403; Error Code: 403 Forbidden; Request ID: null; S3 Extended Request ID: null), S3 Extended Request ID: null
关键现象:
- 单独读取任意一个桶内的文件均正常
- 按固定顺序读取3个不同桶的文件时,第三个文件必报403错误
- 调整读取顺序(将原第三个文件放在首位),所有文件都能正常读取
当前Spark配置:
spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.access.key", configuration.user) spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.secret.key", configuration.password) spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.endpoint", configuration.endpoint) spark_session.sparkContext._jsc.hadoopConfiguration().set( "fs.s3a.impl", "org.apache.hadoop.fs.s3a.S3AFileSystem" ) spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.path.style.access", "true")
依赖包版本:
- hadoop-aws-3.2.0.jar
- aws-java-sdk-bundle-1.11.704.jar
- spark-hadoop-cloud_2.13-3.2.0.jar
这个问题的核心是Hadoop S3A客户端的凭证缓存机制导致跨桶权限冲突——因为GCS兼容S3 API,会触发Hadoop客户端的缓存特性:首次连接某个桶后,客户端会缓存该桶的凭证和连接信息,后续切换到其他桶时,如果没有正确刷新上下文,就会沿用之前的缓存信息,导致权限验证失败。调整顺序后,首次连接的桶凭证能覆盖后续请求,所以不会报错。
解决方法
- 禁用S3A客户端实例缓存
在Spark配置中添加以下参数,强制每个桶请求使用独立的客户端实例,避免凭证复用:
# 禁用文件系统实例缓存,每个桶请求创建新客户端 spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.impl.disable.cache", "true") # 补充配置:确保跨桶时重新验证凭证 spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.auth.type", "ACCESS_KEY") spark_session.sparkContext._jsc.hadoopConfiguration().set("fs.s3a.change.detection.version.required", "false")
其中fs.s3a.impl.disable.cache是核心配置,直接解决缓存冲突问题。
确认桶权限完整性
检查使用的Access Key/Secret Key对三个桶都拥有storage.objects.list和storage.objects.get权限——虽然单独读取正常,但跨桶场景下需确保权限没有遗漏。升级依赖包版本
当前hadoop-aws-3.2.0存在跨桶访问的已知bug,建议升级到hadoop-aws-3.3.4及以上版本,同时对应升级aws-java-sdk-bundle到1.12.500+版本,新版本修复了多个S3A客户端的缓存逻辑问题。
内容的提问来源于stack exchange,提问作者Mateusz

