You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Databricks笔记本下载非Dataframe数据并获取完整Schema?

Databricks 问题解决方案

1. 从Databricks笔记本下载非Dataframe类型的数据

  • 写入DBFS后下载:对于Python中的普通变量(如列表、字典、文本),先写入DBFS临时路径,再通过UI下载:

    # 示例:保存文本数据到DBFS
    raw_data = "需要下载的非Dataframe内容"
    dbutils.fs.put("/tmp/non_df_export.txt", raw_data, overwrite=True)
    

    操作:左侧导航栏「数据」中找到dbfs:/tmp/non_df_export.txt,右键选择「下载」。

  • 直接复制输出:数据量较小时,直接打印变量并复制输出:

    print(your_non_df_data)
    

    点击输出区域的「复制」按钮,粘贴到本地编辑器保存即可。

  • 自动化场景用REST API:如果需要批量或自动下载,调用Databricks DBFS API将文件从DBFS拉取到本地机器。

2. 完整获取Dataframe大Schema(避免截断)

针对df.printSchema()输出被截断的问题,可用以下方法:

  • 转换为格式化JSON打印:将Schema转为JSON字符串,完整输出:

    import json
    # 打印格式化后的完整Schema
    print(json.dumps(json.loads(df.schema.json()), indent=2))
    
  • 保存到DBFS文件:将完整Schema写入文件,再下载查看(无需Hive元存储):

    import json
    full_schema = json.dumps(json.loads(df.schema.json()), indent=2)
    dbutils.fs.put("/tmp/full_schema.json", full_schema, overwrite=True)
    

    后续通过Databricks UI下载该文件即可。

  • 用display交互式查看:在笔记本中执行display(df.schema),会以可展开的交互式表格展示所有字段,无截断问题。

内容的提问来源于stack exchange,提问作者simplycoding

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.06 02:14:57