You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何Dataproc集群未启动SparkSession却存在Spark等进程?

为什么Dataproc集群刚创建就有Spark、YARN等进程?

Dataproc集群创建完成后,会自动启动一批集群基础服务进程,这些不是你启动SparkSession才会生成的任务进程,而是维持集群正常运作的核心组件:

  • YARN服务进程:主节点的ResourceManager、所有节点的NodeManager,YARN是Dataproc的资源调度核心,负责后续任务的资源分配,不管有没有任务都会后台常驻。
  • Spark守护进程:主节点的spark-history-server(记录Spark任务历史)、spark-thriftserver(支持JDBC/ODBC访问),这些是Spark的基础服务,不是具体任务的Driver或Executor进程。
  • MapReduce相关服务:比如主节点的JobHistoryServer,负责记录MapReduce任务历史,也是集群默认启动的基础服务。

你看到的这些都是常驻后台的服务进程,目的是为后续提交Spark、MapReduce等任务提前做好环境准备,和你手动启动SparkSession后产生的临时任务进程(比如Executor、Driver)完全不是一回事。

验证的话,你可以执行yarn application -list,刚创建的集群这个命令应该返回空列表,说明此时并没有实际的计算任务在运行,只是基础服务在待命。

内容的提问来源于stack exchange,提问作者figs_and_nuts

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.10 07:10:22