HDP环境下Spark提交Hive表任务报错:表存在却提示未找到
Spark任务Yarn Cluster模式下找不到已存在Hive表的问题排查
我来帮你拆解下这个典型问题:明明dl_raw.ACC表在Hive里存在,spark-shell也能正常访问,但用spark-submit以Yarn Cluster模式提交任务时却报表不存在的错误,核心原因大多和Cluster模式与本地模式的运行环境差异有关,下面是具体排查方向和解决方案:
1. Yarn Cluster模式未加载Hive配置文件
这是最常见的原因:
- 本地spark-shell启动时会自动读取本地的
hive-site.xml配置,从而连接到正确的Hive Metastore;但Cluster模式下,Driver是在Yarn节点上启动的,默认不会自动获取Hive配置,导致Spark找不到Metastore里的表。 - 解决方法:在
spark-submit命令中通过--files参数携带hive-site.xml,或者直接通过--conf指定Metastore地址:
或者直接指定Metastore配置:export SPARK-MAJOR-VERSION=2 spark-submit --class com.spark.sparkexamples.Audit --master yarn --deploy-mode cluster \ --files /bigdata/datalake/app/config/metadata.csv,/etc/hive/conf/hive-site.xml \ BRNSAUDIT_v4.jar dl_raw.ACC /bigdatahdfs/landing/AUDIT/BW/2017/02/27/ACC_hash_total_and_count_20170227.dat TH 20170227spark-submit --class com.spark.sparkexamples.Audit --master yarn --deploy-mode cluster \ --conf spark.sql.hive.metastore.uris=thrift://<your-metastore-host>:9083 \ --files /bigdata/datalake/app/config/metadata.csv BRNSAUDIT_v4.jar dl_raw.ACC ...
2. Spark SQL大小写敏感配置不一致
- 虽然Hive默认大小写不敏感,但Spark SQL的
spark.sql.caseSensitive配置如果在Cluster模式和本地模式下不一致,可能导致表名匹配失败(比如你代码里写的dl_raw.ACC,Hive里实际是小写dl_raw.acc)。 - 解决方法:在SparkSession构建时显式关闭大小写敏感:
或者在val sparkSession = SparkSession.builder .appName("spark session example") .enableHiveSupport() .config("spark.sql.caseSensitive", false) .getOrCreate()spark-submit命令中添加参数:--conf spark.sql.caseSensitive=false
3. Yarn运行用户无Hive表访问权限
- Cluster模式下,Driver是以Yarn的运行用户(通常是
yarn或提交任务的用户)身份执行的,而spark-shell用的是你的本地用户,两者权限可能不同,导致Yarn用户无法读取dl_raw.ACC表。 - 解决方法:检查Hive表权限并授权:
-- 查看表权限 SHOW GRANT ON TABLE dl_raw.ACC; -- 给Yarn用户授权SELECT权限 GRANT SELECT ON TABLE dl_raw.ACC TO USER yarn;
4. Spark与HDP集群版本兼容性问题
- 你设置了
SPARK-MAJOR-VERSION=2,但如果该版本和HDP集群的Hive版本不兼容,会导致Cluster模式下无法正确连接Metastore(比如HDP 2.6对应Spark 2.2,HDP 3.1对应Spark 2.4)。 - 解决方法:去掉手动设置的
SPARK-MAJOR-VERSION,使用集群默认的Spark版本重新提交任务,确保Spark和Hive版本匹配。
建议先从第一个方向排查,配置文件加载问题是Cluster模式下最容易踩的坑,调整后再逐步验证其他可能。
内容的提问来源于stack exchange,提问作者Vinitkumar
相关产品推荐
相关产品推荐

