如何在databricks-connect>=13.0中配置额外Spark JAR包?
在Databricks Connect >=13.0中配置额外JAR包的方法
Databricks Connect 13.0+采用了全新的客户端-集群交互架构,原有的SparkSession.builder.config('spark.jars.packages')配置方式不再生效,你可以通过以下两种主流方式完成依赖配置:
1. 集群层面预安装依赖(推荐)
直接在Databricks工作区的集群上安装所需Maven库,集群启动后会自动加载依赖,客户端连接后即可直接使用:
- 打开Databricks工作区,进入目标集群的配置页面
- 切换到「库」标签页,点击「安装新库」
- 选择「Maven」类型,在「坐标」输入框中填入依赖坐标:
org.apache.spark:spark-avro_2.12:3.3.0 - 点击「安装」,等待集群加载完成后,客户端连接即可调用该依赖的功能
2. 通过集群初始化脚本自动化配置
如果需要批量或自动化部署集群依赖,可以使用初始化脚本:
- 创建Shell脚本(例如
install_maven_deps.sh),内容如下:#!/bin/bash databricks libraries install --cluster-id <你的集群ID> --maven-coordinates org.apache.spark:spark-avro_2.12:3.3.0 - 将脚本上传至DBFS(例如
dbfs:/databricks/scripts/install_maven_deps.sh) - 在集群配置的「高级选项」→「初始化脚本」中添加该脚本的DBFS路径,集群启动时会自动执行脚本完成依赖安装
客户端代码示例
配置完成后,客户端只需正常连接集群即可使用依赖,无需在代码中指定spark.jars.packages:
from databricks.connect import DatabricksSession spark = DatabricksSession.builder.getOrCreate() # 示例:读取AVRO格式文件 df = spark.read.format("avro").load("/path/to/your/avro/files") df.show()
内容的提问来源于stack exchange,提问作者Lazloo Xp
相关产品推荐
相关产品推荐

