Spark执行过程中,每个Stage是否真的都依赖于前一个Stage?
Spark中Shuffle与Stage执行逻辑的确认
你的理解完全正确:
- 每次数据Shuffle操作都会生成一个新的Stage,所有新Stage都依赖前一个Stage的输出结果,因此Stage之间是顺序执行的,无法并行。
- 但单个Stage内部的多个Task是可以并行执行的,这些Task会被分配到集群的不同节点上同时处理,以此利用集群资源提升处理速度。
内容的提问来源于stack exchange,提问作者Subash Mohanty
相关产品推荐
相关产品推荐

