Spark使用table方法读取Delta表失败问题求助
为什么spark.read.format("delta").table(path)读取本地spark-warehouse下的Delta表失败?
核心问题是你搞混了table()和load()两个方法的用途:
table()方法的参数是Spark元数据中注册的表名(格式通常是数据库名.表名),它会去Spark的元数据(比如Hive Metastore)里查找对应表的存储路径等信息,根本不是用来直接读文件系统路径的。load()方法才是专门用来读取文件系统路径下的Delta表数据的,这就是为什么你用它能正常读取。
再拆解你遇到的两个错误:
- 第一个错误提示
Possibly unquoted identifier spark-warehouse detected:你把路径传给table()后,它把spark-warehouse当成了表标识符,而标识符里的-属于特殊字符,Spark要求用反引号包裹,但这只是解决了格式问题,没改变它找元数据表的本质。 - 第二个
AnalysisException:加了反引号后,Spark还是在元数据里找名为spark-warehouse/data/temp/myuser/unit_test/_delta/test/table的“表”,但这个路径根本没通过CREATE TABLE之类的语句注册到元数据里,自然找不到。
你怀疑的-确实会导致标识符格式报错,但这只是表面问题——就算你把文件夹改成不带特殊字符的名字,用table()传路径还是会失败,因为它的设计逻辑就不是读路径的。
正确用法参考
- 如果非要用
table()方法,得先把路径下的Delta表注册到元数据:# 注册表到元数据 spark.sql("CREATE TABLE my_unit_test USING delta LOCATION '/your/local/path/spark-warehouse/data/temp/myuser/unit_test/_delta/test/table'") # 之后用table()读取 df = spark.read.format("delta").table("my_unit_test") - 不想注册表的话,直接用
load()读路径就好,这也是最直接的方式:df = spark.read.format("delta").load("/your/local/path/spark-warehouse/data/temp/myuser/unit_test/_delta/test/table")
内容的提问来源于stack exchange,提问作者Geosphere
相关产品推荐
相关产品推荐

