非Databricks环境下Delta Lake元数据无法跨Jupyter会话保留问题咨询
问题原因说明
你遇到的问题本质是Spark默认使用的内置Derby元数据存储没有持久化、且存在单会话限制导致的。spark.sql.warehouse.dir仅指定了库表数据的存储路径,库表的元数据(表名、存储格式、路径、分区信息等)是单独存在Metastore服务中的,重启Jupyter内核相当于销毁了原SparkSession,默认的内置Metastore的元数据会随会话销毁丢失,自然无法识别之前创建的表。
解决方案:通过持久化Metastore实现会话独立
完全可以通过Metastore配置实现跨会话的Delta表元数据共享,不需要每次都通过路径访问,常用方案如下:
方案1:外置Hive Metastore(生产/多场景通用)
这是最推荐的方案,支持多会话、多用户共享元数据,配置步骤:
- 提前部署好独立的Hive Metastore服务,将Hive的配置文件
hive-site.xml放到Spark安装目录的conf文件夹下,配置文件中需指定Metastore的服务地址、连接信息 - 构建SparkSession时新增
enableHiveSupport()配置,让Spark绑定外置Hive Metastore存储元数据
修改后的测试代码如下:
from pyspark.sql import SparkSession spark = ( SparkSession.builder .appName("delta_persistent_catalog") .config("spark.jars.packages", "io.delta:delta-core_2.12:1.0.0") .config("spark.sql.extensions", "io.delta.sql.DeltaSparkSessionExtension") .config( "spark.sql.catalog.spark_catalog", "org.apache.spark.sql.delta.catalog.DeltaCatalog", ) .config("spark.sql.warehouse.dir", "/home/user/data") # 启用Hive支持,绑定外置Metastore .enableHiveSupport() .getOrCreate() ) # 首次运行创建表后,重启内核无需重新建表,可直接查询 # df = spark.range(100) # df.write.format("delta").mode("overwrite").saveAsTable("rnd") spark.sql("Select * from rnd").show()
方案2:固定内置Derby Metastore路径(本地测试专用)
如果只是本地单用户测试,不想部署Hive Metastore,可通过固定Derby的存储路径实现元数据持久化,仅需新增一条配置即可:
spark = ( SparkSession.builder .appName("tmp") .config("spark.jars.packages", "io.delta:delta-core_2.12:1.0.0") .config("spark.sql.extensions", "io.delta.sql.DeltaSparkSessionExtension") .config( "spark.sql.catalog.spark_catalog", "org.apache.spark.sql.delta.catalog.DeltaCatalog", ) .config("spark.sql.warehouse.dir", "/home/user/data") # 固定Derby Metastore存储路径 .config("javax.jdo.option.ConnectionURL", "jdbc:derby:;databaseName=/home/user/delta_metastore_db;create=true") .getOrCreate() )
注意:该方案仅支持单Spark会话访问,无法同时开启多个Jupyter内核连接同一个Metastore路径,否则会抛出连接冲突错误。
内容的提问来源于stack exchange,提问作者Christian
相关产品推荐
相关产品推荐

