You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在PySpark代码中获取运行所在的Dataproc集群名称?

在Dataproc集群的PySpark代码中获取当前集群名称

当然可以获取,以下是最直接的实现方式:

  • 读取Spark内置配置属性
    Dataproc集群会自动将自身名称注入到Spark的配置属性spark.dataproc.cluster.name中,你可以直接通过SparkContext读取这个属性:
    from pyspark.sql import SparkSession
    
    # 初始化或获取已有的SparkSession
    spark = SparkSession.builder.getOrCreate()
    # 从配置中提取集群名称
    cluster_name = spark.sparkContext.getConf().get("spark.dataproc.cluster.name")
    # 打印或使用集群名称
    print(f"当前运行的Dataproc集群名称: {cluster_name}")
    

这个方法无需额外依赖,仅适用于在Dataproc集群上运行的PySpark作业,因为该配置属性是Dataproc环境特有的。

内容的提问来源于stack exchange,提问作者djgcp

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.17 23:31:18