如何将本地2GB.pk文件导入Databricks并实现访问?
本地大文件加载到Databricks的可行方案
方案1:通过Databricks CLI上传到DBFS
这是批量上传大文件最稳定的方式,步骤如下:
- 本地终端安装Databricks CLI:执行
pip install databricks-cli - 配置认证:执行
databricks configure --token,按提示输入你的Databricks工作区URL(如https://xxx.cloud.databricks.com)和个人访问令牌(在Databricks工作区的「User Settings」中生成) - 上传文件:执行
dbfs cp /本地文件路径/your_file.pk dbfs:/目标存储路径/your_file.pk --overwrite;批量上传多个文件可使用循环或通配符,比如dbfs cp /本地文件路径/*.pk dbfs:/目标存储路径/ --recursive
上传完成后,在Databricks中可通过dbfs:/目标存储路径/your_file.pk访问文件,示例读取代码:
import pickle with open('/dbfs/目标存储路径/your_file.pk', 'rb') as f: dataset = pickle.load(f)
方案2:通过Databricks UI直接上传到DBFS
适合少量文件的直观操作:
- 打开Databricks工作区,左侧导航栏点击「Data」,切换到「DBFS」标签页
- 找到或创建目标存储目录,点击右上角「Upload」按钮
- 选择本地的.pk文件,等待上传完成(2GB文件在网络稳定的情况下可顺利完成)
- 同样通过
/dbfs/目标存储路径/your_file.pk路径在代码中读取文件
方案3:笔记本临时上传(适合快速实验)
如果只是临时使用一次,可直接在笔记本内上传:
- 打开目标Databricks笔记本,点击右上角「Attach File」按钮
- 选择本地.pk文件,上传后文件会存放在
/dbfs/FileStore/tables/目录下(文件名可能自动添加后缀,注意查看上传提示) - 示例读取代码:
import pickle with open('/dbfs/FileStore/tables/your_file.pk', 'rb') as f: data = pickle.load(f)
注意:该目录属于临时存储,长期使用建议存入DBFS固定目录。
内容的提问来源于stack exchange,提问作者meloncicci
相关产品推荐
相关产品推荐

