如何通过Google Dataproc客户端为Spark作业传递自定义Job ID?
解决Google Dataproc Spark作业自定义Job ID问题
要给Dataproc Spark作业指定自定义Job ID,你需要在提交的job字典中添加reference字段,明确指定job_id参数。修改后的代码如下:
job = { "reference": { "job_id": "your-custom-job-id" # 替换为你想要的自定义Job ID }, "placement": {"cluster_name": cluster_name}, "spark_job": { "main_class": "org.example.App", "jar_file_uris": [ "gs://location.jar", ], "args": [], }, } operation = job_client.submit_job_as_operation( request={"project_id": project_id, "region": region, "job": job} )
注意事项
- 自定义Job ID需在当前项目和区域内唯一,不能与已存在的作业ID重复
- Job ID仅允许包含小写字母、数字、连字符(
-)和下划线(_),长度上限为100字符 - 若指定的ID已存在,API会返回错误,建议加入时间戳或唯一标识确保ID唯一性,比如
my-spark-job-20240520-1430
内容的提问来源于stack exchange,提问作者Faisal Khan
相关产品推荐
相关产品推荐

