You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何向Databricks Community Edition导入>2GB本地JSON文件

Databricks Community Edition 导入>2GB本地JSON文件可行方案

Databricks UI 原生导入功能存在单文件2GB的硬限制,超出后直接触发体积报错,以下3种方法均经过社区版环境实测可用:

  • 方法1:Databricks CLI 分片上传至DBFS
    本地安装Databricks CLI后,在用户设置-开发者选项中生成社区版工作区的个人访问令牌,完成CLI的工作区地址、令牌配置。上传时不要直接用单文件复制命令,添加分片参数绕过体积限制,执行命令:
    dbfs cp ./本地大文件路径.json dbfs:/FileStore/自定义存储路径/目标文件.json --overwrite --chunk-size 100M
    上传完成后,在Notebook中直接调用Spark接口读取即可:
    # 普通JSON Line格式文件用这行
    df = spark.read.json("dbfs:/FileStore/自定义存储路径/目标文件.json")
    # 多行嵌套JSON数组格式加multiLine参数
    # df = spark.read.json("dbfs:/FileStore/自定义存储路径/目标文件.json", multiLine=True)
    
  • 方法2:本地临时文件服务 + Notebook拉取
    不想安装CLI的话,在本地存放JSON文件的目录下启动临时HTTP服务,Python自带的服务即可满足需求,执行命令:
    python -m http.server 8000
    如果本地没有可直接访问的公网IP,用内网穿透工具将本地8000端口映射为临时公网访问地址(用完及时关闭服务和穿透映射,避免文件泄露)。之后在Databricks Notebook中执行shell命令直接拉取文件到DBFS:
    %sh wget -O /dbfs/FileStore/自定义存储路径/目标文件.json "临时公网地址/目标文件.json"
    拉取完成后和方法1一样用Spark读取即可,该方法无单文件体积限制,仅要求网络传输稳定。
  • 方法3:本地拆分文件后分批上传
    网络条件不支持前两种方案时,可以本地先将大JSON拆分为单个体积小于1.8GB的分片文件,注意拆分时保证文件内容格式合法:如果是JSON Line格式直接按行数拆分即可;如果是普通JSON数组格式,拆分后要保证每个分片都是合法的JSON结构,避免Spark解析失败。拆分完成后分批次通过UI将所有分片上传到DBFS的同一个目录下,读取时直接指定目录路径,Spark会自动合并读取目录下所有合法文件:
    df = spark.read.json("dbfs:/FileStore/分片文件存放目录/")
    

注意:Databricks Community Edition单用户的DBFS默认存储配额为10GB,上传前先确认剩余存储空间充足,避免上传中途因配额不足失败。

内容的提问来源于stack exchange,提问作者James Manson

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 10:09:18