Spark中执行REFRESH TABLE是否会更新所有关联表的缓存条目?
结论
调用spark.catalog.refreshTable("table3")不会同步更新其依赖的table1、table2的元数据缓存,你需要对所有关联源表单独执行刷新操作。
原因说明
spark.catalog.refreshTable()的作用范围仅覆盖传入的目标表,只会刷新该表本身的元数据缓存(包括表结构、分区信息、存储路径等),不会递归扫描并刷新该表的所有依赖源表的元数据。- 示例中的
table3是基于table1、table2关联计算得到的临时视图,它的元数据仅记录自身的计算逻辑、Schema信息,和源表的元数据缓存完全独立,刷新table3不会对源表的缓存产生任何影响。 - 如果
table1、table2对应的底层存储数据或表结构在当前Spark会话启动后有过外部更新,必须单独对两张源表执行刷新操作,才能让Spark读取到最新的元数据,避免使用过期缓存导致计算结果错误。
修正后的代码示例
val dataFrame1: DataFrame = ... dataFrame1.createOrReplaceTempView("table1") val dataFrame2: DataFrame = ... dataFrame2.createOrReplaceTempView("table2") // 写入前单独刷新所有依赖的源表 spark.catalog.refreshTable("table1") spark.catalog.refreshTable("table2") val dataFrame3 = spark.sql("select * from table1 inner join table2 .....") dataFrame3.createOrReplaceTempView("table3") // 若后续还有其他逻辑需要使用table3,可按需刷新它的元数据 spark.catalog.refreshTable("table3") dataFrame3.write.parquet("/temp/.....")
内容的提问来源于stack exchange,提问作者izhad
相关产品推荐
相关产品推荐

