如何通过DBX修改Azure Databricks工作流以运行SQL定时任务?
如何修改DBX配置以运行SQL任务?
我正在通过DBX开发面向Azure Databricks的部署流程,需要每日运行一个存储在data.sql文件中的SQL数据任务。我已经掌握了通过Python文件实现该需求的方法,对应的配置如下:
build: python: "pip" environments: default: workflows: - name: "workflow-name" #schedule: quartz_cron_expression: "0 0 9 * * ?" # every day at 9.00 timezone_id: "Europe" format: MULTI_TASK # job_clusters: - job_cluster_key: "basic-job-cluster" <<: *base-job-cluster tasks: - task_key: "task-name" job_cluster_key: "basic-job-cluster" spark_python_task: python_file: "file://filename.py"
我推测需要修改最后两行代码(spark_python_task:和python_file: "file://filename.py"),请问该如何调整配置以运行SQL任务?
你推测的没错,只需要替换任务类型相关配置,将Python任务改为SQL任务即可。修改后的完整配置如下:
build: python: "pip" environments: default: workflows: - name: "workflow-name" #schedule: quartz_cron_expression: "0 0 9 * * ?" # every day at 9.00 timezone_id: "Europe" format: MULTI_TASK # job_clusters: - job_cluster_key: "basic-job-cluster" <<: *base-job-cluster tasks: - task_key: "task-name" job_cluster_key: "basic-job-cluster" spark_sql_task: sql_file: "file://data.sql"
关键修改点:
- 用
spark_sql_task替换原有的spark_python_task,明确任务类型为Spark SQL任务 - 将
python_file参数改为sql_file,并指定你的SQL文件路径file://data.sql
内容的提问来源于stack exchange,提问作者andKaae
相关产品推荐
相关产品推荐

