为何Dataproc集群未启动SparkSession却存在Spark等进程?
为什么Dataproc集群刚创建就有Spark、YARN等进程?
Dataproc集群创建完成后,会自动启动一批集群基础服务进程,这些不是你启动SparkSession才会生成的任务进程,而是维持集群正常运作的核心组件:
- YARN服务进程:主节点的
ResourceManager、所有节点的NodeManager,YARN是Dataproc的资源调度核心,负责后续任务的资源分配,不管有没有任务都会后台常驻。 - Spark守护进程:主节点的
spark-history-server(记录Spark任务历史)、spark-thriftserver(支持JDBC/ODBC访问),这些是Spark的基础服务,不是具体任务的Driver或Executor进程。 - MapReduce相关服务:比如主节点的
JobHistoryServer,负责记录MapReduce任务历史,也是集群默认启动的基础服务。
你看到的这些都是常驻后台的服务进程,目的是为后续提交Spark、MapReduce等任务提前做好环境准备,和你手动启动SparkSession后产生的临时任务进程(比如Executor、Driver)完全不是一回事。
验证的话,你可以执行yarn application -list,刚创建的集群这个命令应该返回空列表,说明此时并没有实际的计算任务在运行,只是基础服务在待命。
内容的提问来源于stack exchange,提问作者figs_and_nuts
相关产品推荐
相关产品推荐

