You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

本地机器连接AWS Databricks集群运行全量代码的替代方案咨询

适用方案汇总

方案1:使用PyCharm内置Databricks远程解释器(推荐)

  • 适用场景:PyCharm专业版2022.3及以上版本原生支持,完全匹配你需要的类似SSH解释器的效果,所有本地编写的代码都会直接在Databricks集群的执行环境上运行,不限制仅Spark代码,普通Python代码、自定义依赖都可以正常执行。
  • 配置步骤:
    1. 打开PyCharm,进入File > Settings > Project: 你的项目名 > Python Interpreter
    2. 点击添加解释器的按钮,选择On Databricks
    3. 按照提示填写AWS Databricks工作区的域名、个人访问令牌(PAT),选择你要绑定的目标集群
    4. 等待解释器同步完成,之后运行代码时就会自动将代码提交到集群执行,运行结果直接返回到本地PyCharm控制台
  • 注意事项:需要提前将你的AWS Databricks集群版本升级到Databricks Runtime 11.3 LTS及以上,否则无法适配PyCharm的远程解释器功能。

方案2:Databricks Repos代码同步运行

  • 适用场景:如果你使用的是PyCharm社区版,无法使用内置远程解释器,可以用这个方案实现全量代码在集群运行。
  • 操作逻辑:提前在Databricks工作区中创建对应的Repos仓库,在本地PyCharm编写代码后,通过git push到绑定的远程仓库,集群会自动拉取最新代码。你可以直接在Databricks界面触发运行,也可以通过本地调用Databricks Jobs REST API触发运行,运行日志可以同步返回本地。
  • 优化技巧:可以在本地写一个简易的触发脚本封装API调用逻辑,代码写完后一键触发集群运行,不需要手动切换到Databricks界面操作,使用体验和本地运行差异不大。

方案3:使用dbx CLI工具实现本地提交全量代码运行

  • 适用场景:专业版、社区版PyCharm都可使用,适合需要自定义运行流程的场景。
  • 操作步骤:
    1. 本地安装dbx工具:pip install dbx
    2. 本地项目根目录下执行dbx configure,按照提示配置AWS Databricks工作区的访问凭证和目标集群信息
    3. 编写完代码后,执行dbx execute --cluster-id 你的集群ID --job 你的作业名即可将当前项目全量代码同步到集群执行,输出直接返回本地控制台。

内容的提问来源于stack exchange,提问作者Borislav Blagoev

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 08:24:11