非Spark Python代码在Spark集群的运行位置咨询(附Databricks文档说明)
非Spark纯Python代码的运行节点说明
这类纯Python代码的运行节点完全取决于它在Spark作业中的位置:
- Driver节点:如果是在Spark作业主流程里直接执行的非Spark代码(比如你提到的原生Python循环、独立调用的Python函数),会在Driver节点运行——这也是Spark UI时间线出现间隙的原因:此时Spark集群处于空闲状态,只有Driver在执行本地代码。
- Worker节点:如果纯Python代码是嵌入在Spark算子(比如
map、flatMap或自定义UDF)内部的逻辑,那么这部分代码会被分发到Worker节点,作为Spark任务的一部分执行,这类执行不会在时间线中表现为间隙,因为属于Spark任务的执行环节。
内容的提问来源于stack exchange,提问作者Matthew
相关产品推荐
相关产品推荐

