You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在databricks-connect>=13.0中配置额外Spark JAR包?

在Databricks Connect >=13.0中配置额外JAR包的方法

Databricks Connect 13.0+采用了全新的客户端-集群交互架构,原有的SparkSession.builder.config('spark.jars.packages')配置方式不再生效,你可以通过以下两种主流方式完成依赖配置:

1. 集群层面预安装依赖(推荐)

直接在Databricks工作区的集群上安装所需Maven库,集群启动后会自动加载依赖,客户端连接后即可直接使用:

  • 打开Databricks工作区,进入目标集群的配置页面
  • 切换到「库」标签页,点击「安装新库」
  • 选择「Maven」类型,在「坐标」输入框中填入依赖坐标:org.apache.spark:spark-avro_2.12:3.3.0
  • 点击「安装」,等待集群加载完成后,客户端连接即可调用该依赖的功能

2. 通过集群初始化脚本自动化配置

如果需要批量或自动化部署集群依赖,可以使用初始化脚本:

  • 创建Shell脚本(例如install_maven_deps.sh),内容如下:
    #!/bin/bash
    databricks libraries install --cluster-id <你的集群ID> --maven-coordinates org.apache.spark:spark-avro_2.12:3.3.0
    
  • 将脚本上传至DBFS(例如dbfs:/databricks/scripts/install_maven_deps.sh)
  • 在集群配置的「高级选项」→「初始化脚本」中添加该脚本的DBFS路径,集群启动时会自动执行脚本完成依赖安装

客户端代码示例

配置完成后,客户端只需正常连接集群即可使用依赖,无需在代码中指定spark.jars.packages:

from databricks.connect import DatabricksSession

spark = DatabricksSession.builder.getOrCreate()
# 示例:读取AVRO格式文件
df = spark.read.format("avro").load("/path/to/your/avro/files")
df.show()

内容的提问来源于stack exchange,提问作者Lazloo Xp

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.05 00:02:14