You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Databricks中启用Disk Cache及配置开机自动执行方法咨询

Azure Databricks 启用Disk Cache并配置自动生效

一、临时启用(单次会话生效)

用你找到的命令即可,注意去掉方括号,直接设置布尔值:

spark.conf.set("spark.databricks.io.cache.enabled", "true")

这个设置只在当前Spark会话里有效,重启集群或开新会话就会重置。

二、配置自动生效(集群启动时自动加载)

有三种常用方式,按需选择:

1. 集群级配置(推荐)

针对单个或指定集群设置,步骤如下:

  • 登录Azure Databricks控制台,进入「集群」页面,选要配置的集群(或新建集群)
  • 切换到「配置」标签页,找到「Spark配置」区域
  • 在文本框里加一行:
    spark.databricks.io.cache.enabled true
    
  • 保存配置后重启集群,下次集群启动就会自动启用Disk Cache

2. 全局初始化脚本(多集群统一配置)

如果要给工作区内所有集群统一配置,用初始化脚本:

  • 写一个Shell脚本(比如enable_disk_cache.sh),内容:
    #!/bin/bash
    echo "spark.databricks.io.cache.enabled true" >> /databricks/driver/conf/spark.driver.extra.conf
    echo "spark.databricks.io.cache.enabled true" >> /databricks/worker/conf/spark.executor.extra.conf
    
  • 把脚本上传到DBFS或云存储(比如ADLS)
  • 在集群配置的「初始化脚本」区域,添加脚本的DBFS路径(比如dbfs:/scripts/enable_disk_cache.sh)
  • 重启集群,脚本会在启动时自动执行完成配置

3. 工作区级全局配置(管理员权限)

如果工作区支持全局Spark配置(需要管理员权限):

  • 进入工作区的「管理控制台」,选「工作区设置」
  • 找到「Spark配置」部分,添加配置项:
    spark.databricks.io.cache.enabled true
    
  • 保存后,所有新建集群会自动应用这个配置,已有集群需要重启才会生效

内容的提问来源于stack exchange,提问作者srv

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.29 19:22:12