You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AWS EMR上spark-submit运行失败:S3访问问题排查求助

问题拆解与解决方案

咱们一步步梳理你的问题:你在EMR主节点用spark-shell加载Jar运行正常,但用spark-submit --deploy-mode cluster提交时失败,AM容器退出码13,核心报错是S3路径不存在,同时还有Skip remote jar的警告。结合你的代码逻辑(先创建文件再读取,创建失败静默忽略),可以确定是权限或资源访问问题导致创建操作未执行成功,进而引发后续读取错误。


一、核心线索分析

1. "Skip remote jar"警告的意义

集群模式下,Driver运行在Worker节点而非主节点,Spark需要把Jar包分发到所有Worker的本地存储。如果Jar在S3上,Driver容器可能因为权限不足或配置问题无法拉取。你提到把Jar复制到主节点~hadoop/目录,但集群模式下Driver不会读取主节点本地文件——必须确保Jar在EMR集群有权访问的S3路径,或者用--jars指定(但集群模式下--jars路径也得是全局可访问的)。不过你说应用已经启动,说明Driver至少加载了Jar,这个警告可能是依赖处理的小问题,但仍需确认权限。

2. 退出码13的指向

Spark AM容器退出码13通常关联权限不足或资源配额不够,结合S3路径报错,大概率是S3权限问题。

3. "路径不存在"的矛盾

你的逻辑是创建文件失败则静默忽略,但报错说明创建操作根本没成功——因为权限不足或其他写入失败的原因被你的静默逻辑掩盖了,导致后续读取时触发路径不存在的错误。


二、可能的原因清单

  • EMR EC2实例角色权限不足:EMR集群默认用EMR_EC2_DefaultRole或自定义EC2角色,如果这个角色没有S3的GetObject/PutObject/ListBucket等权限,就无法读写S3。
  • S3桶策略限制:即使EC2角色有权限,S3桶的Bucket Policy可能拒绝了EMR集群所在VPC/IP的访问。
  • Jar包分发问题:主节点本地的Jar无法被Worker节点访问,必须放在集群可访问的S3路径。
  • 静默忽略的逻辑坑:创建文件失败时没有记录日志,导致无法定位具体失败原因(比如权限、路径拼写、区域不匹配等)。
  • 硬编码Master的隐患:代码里硬写了.master("local[*]"),虽然集群模式下Spark会忽略这个配置,但如果有依赖本地模式的逻辑,可能引发意外问题(不过这大概率不是当前核心问题)。

三、获取更多调试信息的方法

  1. 查看EMR Step日志:在EMR控制台的「Steps」标签下找到失败任务,点击「View logs」查看Driver和Executor的完整日志——哪怕你代码里静默忽略错误,日志里可能会留下未捕获异常的痕迹。
  2. 给代码加日志:修改创建文件的逻辑,不要静默忽略,添加日志记录:
    try {
      // 创建Parquet文件的逻辑
      spark.write.parquet(s"s3://my-bucket/${args(0)}.parquet")
    } catch {
      case e: Exception =>
        // 用Spark日志系统记录详细错误
        org.apache.log4j.Logger.getLogger(this.getClass).error("创建Parquet文件失败", e)
    }
    
    重新编译Jar提交后,就能在日志里看到创建失败的具体原因。
  3. 直接测试S3权限:在EMR主节点用hadoop fs命令验证读写权限:
    # 列出桶内文件
    hadoop fs -ls s3://my-bucket/
    # 上传测试文件
    echo "test" > test.txt && hadoop fs -put test.txt s3://my-bucket/test.txt
    # 下载测试文件
    hadoop fs -get s3://my-bucket/test.txt test_download.txt
    # 删除测试文件
    hadoop fs -rm s3://my-bucket/test.txt
    
    如果这些命令失败,说明确实是权限问题;如果成功,可能是应用代码的权限上下文问题(不过EMR上Spark默认用hadoop用户,和主节点一致)。

四、确保EMR与S3权限正常的步骤

  1. 检查EC2实例角色权限:
    登录AWS IAM控制台,找到EMR集群使用的EC2实例角色(比如EMR_EC2_DefaultRole),确保它有S3相关权限。测试可以用AmazonS3FullAccess策略,生产环境建议最小权限,比如自定义策略:
    {
      "Version": "2012-10-17",
      "Statement": [
        {
          "Effect": "Allow",
          "Action": ["s3:GetObject", "s3:PutObject", "s3:ListBucket", "s3:DeleteObject"],
          "Resource": ["arn:aws:s3:::my-bucket", "arn:aws:s3:::my-bucket/*"]
        }
      ]
    }
    
  2. 检查S3桶策略:
    进入S3控制台,找到目标桶的「Permissions」->「Bucket Policy」,确保没有拒绝EMR集群访问的规则。比如不要有类似拒绝非指定IP访问的策略,如果有,修改为允许EC2角色或VPC IP范围访问。
  3. 确认EMRFS配置:
    EMR默认启用EMRFS来访问S3,主节点的/etc/hadoop/conf/core-site.xml里会有相关配置,无需硬编码密钥——EMR会自动用IAM角色认证。

五、临时验证方法

  1. 改用Client模式提交:
    spark-submit --deploy-mode client --class com.MyCompany.MyMainClass s3://my-bucket/myApplication.jar dataset1234
    
    Client模式下Driver运行在主节点,用主节点的权限,如果spark-shell能运行成功,Client模式也应该能成功,这样可以确认是集群模式下的权限/分发问题。
  2. 移除硬编码的Master配置:
    把代码里的.master("local[*]")删掉,让spark-submit的参数指定集群模式:
    val spark = SparkSession.builder()
      .appName("myApp")
      .getOrCreate()
    

内容的提问来源于stack exchange,提问作者sousvide

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.11 07:52:15