本地机器连接AWS Databricks集群运行全量代码的替代方案咨询
适用方案汇总
方案1:使用PyCharm内置Databricks远程解释器(推荐)
- 适用场景:PyCharm专业版2022.3及以上版本原生支持,完全匹配你需要的类似SSH解释器的效果,所有本地编写的代码都会直接在Databricks集群的执行环境上运行,不限制仅Spark代码,普通Python代码、自定义依赖都可以正常执行。
- 配置步骤:
- 打开PyCharm,进入
File > Settings > Project: 你的项目名 > Python Interpreter - 点击添加解释器的按钮,选择
On Databricks - 按照提示填写AWS Databricks工作区的域名、个人访问令牌(PAT),选择你要绑定的目标集群
- 等待解释器同步完成,之后运行代码时就会自动将代码提交到集群执行,运行结果直接返回到本地PyCharm控制台
- 打开PyCharm,进入
- 注意事项:需要提前将你的AWS Databricks集群版本升级到Databricks Runtime 11.3 LTS及以上,否则无法适配PyCharm的远程解释器功能。
方案2:Databricks Repos代码同步运行
- 适用场景:如果你使用的是PyCharm社区版,无法使用内置远程解释器,可以用这个方案实现全量代码在集群运行。
- 操作逻辑:提前在Databricks工作区中创建对应的Repos仓库,在本地PyCharm编写代码后,通过
git push到绑定的远程仓库,集群会自动拉取最新代码。你可以直接在Databricks界面触发运行,也可以通过本地调用Databricks Jobs REST API触发运行,运行日志可以同步返回本地。 - 优化技巧:可以在本地写一个简易的触发脚本封装API调用逻辑,代码写完后一键触发集群运行,不需要手动切换到Databricks界面操作,使用体验和本地运行差异不大。
方案3:使用dbx CLI工具实现本地提交全量代码运行
- 适用场景:专业版、社区版PyCharm都可使用,适合需要自定义运行流程的场景。
- 操作步骤:
- 本地安装dbx工具:
pip install dbx - 本地项目根目录下执行
dbx configure,按照提示配置AWS Databricks工作区的访问凭证和目标集群信息 - 编写完代码后,执行
dbx execute --cluster-id 你的集群ID --job 你的作业名即可将当前项目全量代码同步到集群执行,输出直接返回本地控制台。
- 本地安装dbx工具:
内容的提问来源于stack exchange,提问作者Borislav Blagoev
相关产品推荐
相关产品推荐

