Azure Databricks中启用Disk Cache及配置开机自动执行方法咨询
Azure Databricks 启用Disk Cache并配置自动生效
一、临时启用(单次会话生效)
用你找到的命令即可,注意去掉方括号,直接设置布尔值:
spark.conf.set("spark.databricks.io.cache.enabled", "true")
这个设置只在当前Spark会话里有效,重启集群或开新会话就会重置。
二、配置自动生效(集群启动时自动加载)
有三种常用方式,按需选择:
1. 集群级配置(推荐)
针对单个或指定集群设置,步骤如下:
- 登录Azure Databricks控制台,进入「集群」页面,选要配置的集群(或新建集群)
- 切换到「配置」标签页,找到「Spark配置」区域
- 在文本框里加一行:
spark.databricks.io.cache.enabled true - 保存配置后重启集群,下次集群启动就会自动启用Disk Cache
2. 全局初始化脚本(多集群统一配置)
如果要给工作区内所有集群统一配置,用初始化脚本:
- 写一个Shell脚本(比如
enable_disk_cache.sh),内容:#!/bin/bash echo "spark.databricks.io.cache.enabled true" >> /databricks/driver/conf/spark.driver.extra.conf echo "spark.databricks.io.cache.enabled true" >> /databricks/worker/conf/spark.executor.extra.conf - 把脚本上传到DBFS或云存储(比如ADLS)
- 在集群配置的「初始化脚本」区域,添加脚本的DBFS路径(比如
dbfs:/scripts/enable_disk_cache.sh) - 重启集群,脚本会在启动时自动执行完成配置
3. 工作区级全局配置(管理员权限)
如果工作区支持全局Spark配置(需要管理员权限):
- 进入工作区的「管理控制台」,选「工作区设置」
- 找到「Spark配置」部分,添加配置项:
spark.databricks.io.cache.enabled true - 保存后,所有新建集群会自动应用这个配置,已有集群需要重启才会生效
内容的提问来源于stack exchange,提问作者srv
相关产品推荐
相关产品推荐

