You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将Azure Databricks SQL及Spark DB的数据加载至GCP Databricks对应库?

Azure Databricks 到 GCP Databricks 的数据迁移方案

一、Azure Databricks SQL 数据加载到 GCP Databricks SQL

方法1:文件导出+云存储同步+导入

  • 在Azure Databricks SQL中,将目标数据导出为Parquet、CSV等格式,存储到Azure Blob Storage。
  • 通过AzCopy或GCP Storage Transfer Service,将Blob Storage中的数据文件同步至GCP Cloud Storage。
  • 在GCP Databricks SQL中使用COPY INTO命令将数据导入目标表:
COPY INTO gcp_target_db.target_table
FROM 'gs://your-gcp-bucket/data-path'
FILEFORMAT = PARQUET
COPY_OPTIONS ('mergeSchema' = 'true')

方法2:JDBC直接跨云读取

  • 确保Azure与GCP网络互通(如VPC peering、VPN),在GCP Databricks SQL中配置Azure Databricks SQL的JDBC连接参数。
  • 执行CREATE TABLE AS SELECT直接拉取数据:
CREATE TABLE gcp_target_db.target_table AS
SELECT * FROM JDBC.`jdbc:databricks://<azure-workspace-url>:443/sql/1.0/warehouses/<warehouse-id>`
OPTIONS (
  user='<azure-databricks-username>',
  password='<azure-databricks-password>'
)

二、Azure Databricks Spark DB 到 GCP Databricks Spark DB 的简便方法

方法1:Delta Sharing 跨云共享(最简便)

  • 在Azure Databricks中,将Spark DB的目标表配置为Delta Sharing共享对象,生成共享链接与访问凭证。
  • 在GCP Databricks中添加该共享数据源,读取后写入本地Spark DB:
# 读取Azure端共享的Delta表
shared_data = spark.read.format("deltaSharing").load("<delta-sharing-url>#<share-name>.<schema-name>.<table-name>")
# 写入GCP Spark DB目标表
shared_data.write.mode("overwrite").saveAsTable("gcp_spark_db.target_table")

方法2:云存储同步+Spark直接读写

  • 将Azure Databricks Spark DB的Delta表数据从Azure Data Lake Storage Gen2同步到GCP Cloud Storage(可通过Azure Data Factory或GCP Storage Transfer Service)。
  • 在GCP Databricks中读取Cloud Storage的Delta文件并保存为Spark DB表:
delta_data = spark.read.format("delta").load("gs://your-gcp-bucket/delta-table-path")
delta_data.write.mode("overwrite").saveAsTable("gcp_spark_db.target_table")

方法3:跨云Databricks Job直接迁移

  • 创建跨云Databricks Job,在Azure Databricks集群中读取Spark DB数据,直接写入GCP Spark DB(需在Azure集群中配置GCP服务账号密钥以访问GCP资源):
# 读取Azure Spark DB源表
source_data = spark.read.table("azure_spark_db.source_table")
# 写入GCP Spark DB目标表
source_data.write.mode("overwrite").saveAsTable("gcp_spark_db.target_table")

内容的提问来源于stack exchange,提问作者user3402692

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.06 04:35:55