Databricks中schemaEvolutionMode与schemaLocation无法协同工作问题
Parquet流读取中同时配置schemaLocation与schemaEvolutionMode的问题
我需要从Parquet文件读取流数据,由于后续可能新增列,希望结合现有Schema进行schema evolution。但同时配置cloudFiles.schemaLocation和cloudFiles.schemaEvolutionMode='addNewColumns'的代码无法运行:
spark.readStream.format('cloudFiles') .option('cloudFiles.format', 'parquet') .option('cloudFiles.inferColumnTypes', 'true') .option('cloudFiles.schemaLocation', schema_path) .option('cloudFiles.schemaEvolutionMode', 'addNewColumns') .load(input_path))
但单独配置其中任意一项的两段代码均可正常运行:
第一段(仅配置schemaEvolutionMode):
spark.readStream.format('cloudFiles') .option('cloudFiles.format', 'parquet') .option('cloudFiles.inferColumnTypes', 'true') .option('cloudFiles.schemaEvolutionMode', 'addNewColumns') .load(input_path))
第二段(仅配置schemaLocation):
spark.readStream.format('cloudFiles') .option('cloudFiles.format', 'parquet') .option('cloudFiles.inferColumnTypes', 'true') .option('cloudFiles.schemaLocation', schema_path) .load(input_path))
内容的提问来源于stack exchange,提问作者Aditya Raj
相关产品推荐
相关产品推荐

