在EMR中使用Spark Shell+Hudi+S3时遇Glue:GetDatabase权限拒绝问题
在AWS EMR环境中运行Spark Shell,结合Hudi将数据写入S3,且Glue数据库「default」已创建完成。执行以下Scala代码:
(inputDF.write .format("hudi") .options(hudiOptions) .option(DataSourceWriteOptions.OPERATION_OPT_KEY,"insert") .mode(SaveMode.Overwrite) .save("s3a://oh-project-sunnyvalelabs-observed/marketing/"))
执行过程中出现如下日志及错误:
SLF4J: 无法加载类「org.slf4j.impl.StaticLoggerBinder」。
SLF4J: 默认使用无操作(NOP)日志实现
24/08/13 20:40:34 WARN HoodieSparkSqlWriterInternal: s3a://oh-project-sunnyvalelabs-observed/marketing路径下的Hudi表已存在。正在删除现有数据并覆盖为新数据。
24/08/13 20:40:36 WARN HiveConf: 不存在名为hive.server2.thrift.url的HiveConf配置项
24/08/13 20:40:36 ERROR AWSCatalogMetastoreClient: 无法验证default数据库是否存在:
com.amazonaws.services.glue.model.AccessDeniedException: 用户:arn:aws:sts::654654235321:assumed-role/AmazonEMR-InstanceProfile-20240813T103425/i-0bbd3af62642a1490 未被授权执行操作:glue:GetDatabase,资源:arn:aws:glue:us-west-2:654654235321:catalog,原因:没有基于身份的策略允许glue:GetDatabase操作(服务:AWSGlue;状态码:400;错误码:AccessDeniedException;请求ID:83a34deb-a334-4e38-96bb-14ff195f525b;代理:null)
核心问题是EMR实例使用的IAM角色缺少Glue相关权限,按以下步骤处理:
- 补充Glue权限
找到报错中提到的EMR实例角色AmazonEMR-InstanceProfile-20240813T103425,在IAM控制台编辑该角色的权限策略,添加允许glue:GetDatabase操作的语句,示例策略如下:
若需要Hudi完整同步Glue元数据,可额外添加{ "Effect": "Allow", "Action": [ "glue:GetDatabase" ], "Resource": [ "arn:aws:glue:us-west-2:654654235321:database/default", "arn:aws:glue:us-west-2:654654235321:catalog" ] }glue:CreateTable、glue:UpdateTable等权限,生产环境遵循最小权限原则,避免过度授权。 - 处理SLF4J警告(可选)
该警告不影响功能执行,若要消除,启动Spark Shell时添加SLF4J绑定依赖:spark-shell --packages org.slf4j:slf4j-log4j12:1.7.36 - 处理HiveConf警告(可选)
若无需同步Hive元数据,在Hudi配置中添加hoodie.datasource.write.metastore.enabled=false,关闭元数据同步即可避免该警告。
内容的提问来源于stack exchange,提问作者Albert T. Wong

