You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Databricks Workflows中批量安装requirements.txt依赖库?

高效管理Databricks Workflows中Python脚本的依赖

方法1:直接通过作业库上传requirements.txt

在Databricks Workflows创建/编辑作业时,找到「Libraries」选项卡:

  • 点击「Install new library」,选择「PyPI」类型
  • 在「Package」输入框中直接上传本地的requirements.txt文件,Databricks会自动解析并安装所有依赖
  • 若存在版本冲突或私有包,需在requirements.txt中明确指定版本;私有包可配合Databricks的PyPI镜像或内部仓库配置使用

方法2:用Databricks CLI批量配置依赖

习惯命令行操作的话,可通过Databricks CLI快速导入requirements.txt中的依赖:

  1. 提前配置并登录目标Workspace的Databricks CLI
  2. 运行以下命令批量创建库并关联到指定作业:
    # 读取requirements.txt,逐个创建PyPI库并记录库ID
    while read pkg; do
      databricks libraries create --pypi-package "$pkg" --output json | jq -r '.id' >> library_ids.txt
    done < requirements.txt
    # 将创建好的库关联到目标作业(替换<job-id>为你的作业ID)
    databricks jobs update --job-id <job-id> --libraries "$(cat library_ids.txt | xargs -I {} echo '{"library_id": "{}"}' | jq -s .)"
    
    注:需提前安装jq工具处理JSON输出

方法3:创建工作区共享库复用依赖

若多个作业需要相同依赖,可先创建共享库统一管理:

  • 在Databricks控制台「Libraries」页面点击「Create Library」
  • 选择「PyPI」类型并上传requirements.txt,完成后将库发布到工作区
  • 后续在作业配置中直接选择该共享库,无需重复输入依赖项

方法4:用集群初始化脚本安装依赖(适合复杂环境)

如果依赖需要额外配置(如编译底层库、从私有源拉取),可编写初始化脚本:

  1. 创建bash脚本(如install_deps.sh),内容示例:
    pip install -r /dbfs/path/to/requirements.txt
    
  2. 将脚本上传到DBFS或Databricks工作区
  3. 在作业使用的集群配置中,添加「Init Scripts」并指定脚本路径,集群启动时会自动执行依赖安装

注意事项

  • 确保requirements.txt中的包版本与Databricks Runtime兼容,避免与Runtime自带的Spark、PySpark等组件版本冲突
  • 私有PyPI包需在集群配置的「Advanced Options」→「Spark」→「Spark config」中添加spark.databricks.pypi.index.url指定私有源地址

内容的提问来源于stack exchange,提问作者SemsemT

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 11:27:17