You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Databricks无服务器计算中连接MySQL RDS集群获取数据?

可行的替代方案

1. 使用Python原生MySQL客户端库

Databricks无服务器计算支持安装第三方Python包,你可以用pymysql或mysql-connector-python直接连接MySQL RDS,无需依赖JDBC驱动。

操作步骤:

  • 先在笔记本中安装依赖包:
%pip install pymysql
  • 编写连接代码并读取数据:
import pymysql
import pandas as pd

# 配置RDS连接参数
host = "your-rds-endpoint"
user = "your-db-username"
password = "your-db-password"
database = "target-db-name"

# 建立数据库连接
conn = pymysql.connect(host=host, user=user, password=password, database=database)

# 执行查询并读取为Pandas DataFrame
query = "SELECT * FROM your-target-table"
pd_df = pd.read_sql(query, conn)

# 转为Spark DataFrame(如需用Spark进行后续处理)
spark_df = spark.createDataFrame(pd_df)

# 关闭连接
conn.close()

2. 通过S3中间层同步数据

如果需要批量或定期同步数据,可以先将MySQL RDS的数据同步到S3(可借助AWS Glue、Data Pipeline或自定义Python脚本实现),再用Databricks无服务器计算读取S3上的结构化文件(如Parquet、CSV或Delta格式)。

示例:读取S3上的Parquet文件

spark_df = spark.read.parquet("s3://your-bucket/path/to/synced-data/")

3. 基于Delta Live Tables实现增量同步

若需持续同步MySQL数据到Databricks,可结合CDC(变更数据捕获)工具将MySQL增量数据同步到S3,再用Databricks Delta Live Tables的Auto Loader功能自动加载并处理这些增量数据,实现数据的实时同步。


内容的提问来源于stack exchange,提问作者abc_23

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.18 18:43:11