Spark开启AQE倾斜Join未生效 数据倾斜问题排查
Spark AQE倾斜Join优化未生效问题
问题现象
- 开展两个数据集的Join计算时出现性能异常:参与Join的1~2个数据集的关联列存在数据倾斜,整体Join耗时极高。
- 已开启Spark AQE自适应查询执行及AQE倾斜Join优化能力,期望解决倾斜Join的性能问题,但核查SQL查询运行指标后发现AQE并未对数据倾斜做优化处理,仍存在部分分区数据量过大的情况。
- 进一步查看Stage运行状态可见,少量长尾任务需要数小时才能完成。
相关SQL查询运行指标截图如下:
当前使用配置
任务配置的Spark参数如下:
.config("spark.sql.adaptive.enabled", "true") \ .config("spark.sql.adaptive.skewJoin.enabled", "true") \ .config("spark.executor.memory", "32g") \ .config("spark.executor.memoryOverhead", "8g") \ .config("spark.sql.shuffle.partitions", "2000") \
排查诉求
目前无法判定问题是配置错误还是遗漏了必要设置,需要对应的问题定位指引。
内容的提问来源于stack exchange,提问作者Michael_Van
相关产品推荐
相关产品推荐

