You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Databricks的Repo工作区读取其他工作区文件夹的JSON文件

解决Databricks Repo Notebook读取工作区其他文件夹JSON文件的问题

核心原因

你用普通Python open() 方法失败,是因为Databricks仅将Repo目录挂载到Notebook的本地文件系统,其他工作区文件夹(如TestWS)没有被挂载,所以无法直接通过本地路径访问。以下是几种可行的解决办法:


方法1:使用dbutils.fs直接读取文件

Databricks提供的dbutils.fs工具可以访问整个工作区的文件,适合小到中等大小的JSON文件:

方式A:读取文件内容后解析

import json

# 读取文件全部内容
file_content = dbutils.fs.head("/Workspace/TestWS/test.json")
# 解析为JSON对象
js = json.loads(file_content)

方式B:流式读取(适合较大文件)

import json

with dbutils.fs.open("/Workspace/TestWS/test.json", "r") as f:
    js = json.load(f)

方法2:复制文件到Repo目录后读取

如果需要保持用open()的习惯,可以先将TestWS中的文件复制到当前Notebook所在的Repo目录,再用普通Python方法读取:

# 复制工作区文件到当前Notebook的本地目录
dbutils.fs.cp("/Workspace/TestWS/test.json", "./test.json")

# 用open读取
import json
with open("./test.json", "r") as f:
    js = json.load(f)

方法3:用Spark API读取(适合大文件或需要后续数据分析)

如果JSON文件较大,或者后续需要进行数据处理,推荐用Spark读取后转为Python对象:

from pyspark.sql import SparkSession
import json

spark = SparkSession.builder.getOrCreate()
# 读取JSON文件为DataFrame
df = spark.read.json("/Workspace/TestWS/test.json")
# 将DataFrame转为JSON字符串再解析为Python对象
js = json.loads(df.toJSON().collect()[0])

注意:如果JSON文件是多行格式(每行一个JSON对象),可以添加multiLine=True参数:

df = spark.read.json("/Workspace/TestWS/test.json", multiLine=True)

内容的提问来源于stack exchange,提问作者Mohammad Rijwan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 15:47:17