已完成预分区的数据执行groupby属于宽变换还是窄变换?
你对Narrow transformation(窄变换)和Wide transformation(宽变换)的基础定义理解是正确的。
常见宽变换清单
除了sort之外,常用的宽变换还包括:
- 按Key聚合类:
groupBy/groupByKey、reduceByKey、aggregateByKey、combineByKey - 关联类:
join、cogroup(两张表分区规则完全匹配的场景除外) - 集合运算类:
distinct、intersection、subtract - 重分区类:
repartition、触发shuffle的coalesce
关于groupBy认知的疏漏点
你的误区在于把「数据实际分布状态」和「Spark的shuffle判定规则」混淆了:
宽变换的判定核心是算子是否触发shuffle,而Spark判断是否需要执行shuffle的依据是上下游RDD的分区器是否匹配,不是数据实际有没有同Key落在同一分区。
哪怕你手动保证了所有同Key数据都在同一个分区,只要这个RDD没有配置和groupBy规则匹配的分区器,Spark识别不到分区规则的关联性,还是会默认触发shuffle,把groupBy判定为宽变换。
另外两种场景哪怕上游有匹配的分区器,groupBy还是会触发shuffle:
- 分组Key和上游分区Key不一致:比如上游是按用户ID分区,你现在按订单ID分组
- 分组时指定了和上游不同的分区数:比如上游按Key分了8个分区,你执行
groupBy时指定了16个分区
内容的提问来源于stack exchange,提问作者figs_and_nuts
相关产品推荐
相关产品推荐

