You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Dataproc的spark-submit作业中使用--properties-file参数?

使用gcloud spark-submit的--properties-file选项指南

基本用法

--properties-file选项能让你通过本地配置文件批量传递Spark配置和Dataproc集群属性,不用在命令行里逐个输入一堆参数。

步骤1:创建配置文件

新建一个文本文件(比如命名为spark-config.properties),按照key=value的格式写入需要的配置项:

# Spark应用核心配置
spark.driver.memory=4g
spark.executor.cores=2
spark.executor.memory=8g

# Dataproc集群专属属性(可选)
dataproc:dataproc.conscrypt.provider.enable=true

注意:配置分两类——前缀为spark.的是Spark原生配置,前缀为dataproc:的是Dataproc集群特有的属性。

步骤2:在提交命令中引用配置文件

执行gcloud dataproc jobs submit spark时,通过--properties-file指定配置文件的本地路径即可:

gcloud dataproc jobs submit spark \
    --cluster=你的集群名称 \
    --region=你的集群区域 \
    --properties-file=./spark-config.properties \
    --class=你的主类全路径 \
    --jars=gs://你的存储桶路径/应用jar包.jar

配置优先级说明

如果命令行同时使用--properties(单个配置项)和--properties-file,命令行的--properties会覆盖配置文件里的同名项。比如:

gcloud dataproc jobs submit spark \
    --cluster=你的集群名称 \
    --region=你的集群区域 \
    --properties-file=./spark-config.properties \
    --properties=spark.driver.memory=6g \
    --class=你的主类全路径 \
    --jars=gs://你的存储桶路径/应用jar包.jar

这时spark.driver.memory会以命令行指定的6g为准,而非配置文件中的4g。

常用配置示例

  • 调整Spark executor资源:
spark.executor.instances=5
spark.executor.memory=10g
spark.executor.cores=4
  • 配置Spark日志级别:
spark.driver.extraJavaOptions=-Dlog4j.configuration=file:///本地日志配置路径/log4j.properties
spark.executor.extraJavaOptions=-Dlog4j.configuration=file:///本地日志配置路径/log4j.properties
  • 启用Dataproc额外组件:
dataproc:dataproc.components.enable=ANACONDA,JUPYTER

内容的提问来源于stack exchange,提问作者Aman Ranjan Verma

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.18 04:10:34