Spark中DataFrame多表左连接报笛卡尔积错误,两种写法结果不同是什么原因
问题原因说明
这不是Spark的bug,核心是两种join写法的列引用逻辑差异导致的,和Spark逻辑计划阶段的列绑定规则直接相关。
第一种写法报错的根因
你写的报错代码逻辑存在列引用失效的问题:
a.join(b, b("id") === a("id"), "leftouter").drop(b("id")) .join(c, c("id") === a("id"), "leftouter").drop(c("id"))
Spark的列引用是和逻辑计划节点绑定的,不是按照你代码里的DataFrame变量名绑定的:
- 第一次
a join b完成后生成的新DataFrame,你手动drop了b表的id列,仅保留了来自a表的id列 - 第二次和c表join时,你写的关联条件
c("id") === a("id")里的a("id"),已经无法和第一步生成的新DataFrame里的id列完成绑定,Spark分析器会判定这个关联条件没有关联左右两个join逻辑计划的公共列,符合笛卡尔积的特征,所以直接抛出异常。
第二种写法正常运行的原因
用Seq("id")作为join条件的写法,是Spark提供的等值join语法糖:
a.join(b, Seq("id"), "leftouter") .join(c, Seq("id"), "leftouter")
这个写法会自动关联左右表同名的id列,且join完成后只会保留一份id列,不需要手动drop。后续和c表join时,直接用前一步生成的DataFrame里留存的id列和c表的id列关联,整个逻辑计划的列绑定关系清晰,不存在关联键缺失的问题,所以可以正常运行。
额外补充
如果一定要用第一种写法的风格,你可以把第一次join后的结果里的id列别名存下来,或者直接引用转换后DataFrame的id列,比如:
val ab = a.join(b, b("id") === a("id"), "leftouter").drop(b("id")) ab.join(c, c("id") === ab("id"), "leftouter").drop(c("id"))
这样就不会出现列绑定失效的问题。
内容的提问来源于stack exchange,提问作者Vikas
相关产品推荐
相关产品推荐

