You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Databricks中将Python DataFrame转换为SQL表或临时视图?

将Python DataFrame转换为Databricks SQL可查询的表

下面是几种实用的转换方法,适配不同场景需求:

方法1:创建临时表(仅当前会话可用)

临时表只在当前Notebook会话中存在,关闭会话就自动删除,适合临时测试或一次性查询。执行Python代码:

# 假设你的SharePoint导入后的DataFrame名为sp_df
sp_df.createOrReplaceTempView("sharepoint_temp_table")

之后在Databricks SQL中直接查询:

SELECT * FROM sharepoint_temp_table;

方法2:创建全局临时表(跨会话可用,集群重启后消失)

如果需要在多个Notebook会话中共享数据,但不需要长期保存,用全局临时表——它默认存放在global_temp系统数据库下:

sp_df.createOrReplaceGlobalTempView("sharepoint_global_temp_table")

查询时必须指定数据库前缀:

SELECT * FROM global_temp.sharepoint_global_temp_table;

方法3:创建永久表(长期保存,跨集群可用)

适合生产环境,数据会长期存储在指定位置,所有有权限的用户都能跨集群查询。

步骤1:(可选)创建专属数据库

先建一个数据库来管理SharePoint相关表,避免和其他表混在一起:

CREATE DATABASE IF NOT EXISTS sharepoint_db;

或者用Python代码执行:

spark.sql("CREATE DATABASE IF NOT EXISTS sharepoint_db")

步骤2:写入永久表

有两种常用写法:

写法A:直接用DataFrame的saveAsTable方法

# mode参数可按需选择:overwrite(覆盖现有表)、append(追加数据)、ignore(表存在则跳过)、error(表存在则报错,默认)
sp_df.write.mode("overwrite").saveAsTable("sharepoint_db.sharepoint_permanent_table")

写法B:先转临时表再生成永久表

sp_df.createOrReplaceTempView("temp_sp_table")
spark.sql("CREATE OR REPLACE TABLE sharepoint_db.sharepoint_permanent_table AS SELECT * FROM temp_sp_table")

之后在Databricks SQL中直接查询永久表:

SELECT * FROM sharepoint_db.sharepoint_permanent_table;

注意事项

  • Databricks会自动映射DataFrame的字段类型到SQL表,但如果有复杂结构(比如嵌套数组、字典),可能需要提前调整字段类型确保兼容。
  • 永久表默认存在DBFS中,也可以通过option("path", "/mnt/your-custom-storage")指定自定义存储路径。

内容的提问来源于stack exchange,提问作者Elise Joyce

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.16 23:30:57