You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将本地2GB.pk文件导入Databricks并实现访问?

本地大文件加载到Databricks的可行方案

方案1:通过Databricks CLI上传到DBFS

这是批量上传大文件最稳定的方式,步骤如下:

  • 本地终端安装Databricks CLI:执行 pip install databricks-cli
  • 配置认证:执行 databricks configure --token,按提示输入你的Databricks工作区URL(如https://xxx.cloud.databricks.com)和个人访问令牌(在Databricks工作区的「User Settings」中生成)
  • 上传文件:执行 dbfs cp /本地文件路径/your_file.pk dbfs:/目标存储路径/your_file.pk --overwrite;批量上传多个文件可使用循环或通配符,比如 dbfs cp /本地文件路径/*.pk dbfs:/目标存储路径/ --recursive

上传完成后,在Databricks中可通过dbfs:/目标存储路径/your_file.pk访问文件,示例读取代码:

import pickle
with open('/dbfs/目标存储路径/your_file.pk', 'rb') as f:
    dataset = pickle.load(f)

方案2:通过Databricks UI直接上传到DBFS

适合少量文件的直观操作:

  • 打开Databricks工作区,左侧导航栏点击「Data」,切换到「DBFS」标签页
  • 找到或创建目标存储目录,点击右上角「Upload」按钮
  • 选择本地的.pk文件,等待上传完成(2GB文件在网络稳定的情况下可顺利完成)
  • 同样通过/dbfs/目标存储路径/your_file.pk路径在代码中读取文件

方案3:笔记本临时上传(适合快速实验)

如果只是临时使用一次,可直接在笔记本内上传:

  • 打开目标Databricks笔记本,点击右上角「Attach File」按钮
  • 选择本地.pk文件,上传后文件会存放在/dbfs/FileStore/tables/目录下(文件名可能自动添加后缀,注意查看上传提示)
  • 示例读取代码:
import pickle
with open('/dbfs/FileStore/tables/your_file.pk', 'rb') as f:
    data = pickle.load(f)

注意:该目录属于临时存储,长期使用建议存入DBFS固定目录。

内容的提问来源于stack exchange,提问作者meloncicci

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.11 06:30:56