使用Auto Loader加载含自定义分隔符CSV数据的配置问题咨询
Databricks Auto Loader的CSV格式兼容原生Spark CSV读取的所有配置参数,你只需要额外添加sep参数指定自定义分隔符即可。
修改后的代码如下:
spark.readStream.format("cloudFiles") \ .option("cloudFiles.format", "csv") \ .option("sep", "~|~") \ # The schema location directory keeps track of your data schema over time .option("cloudFiles.schemaLocation", "<path-to-checkpoint>") \ .load("<path-to-source-data>") \ .writeStream \ .option("mergeSchema", "true") \ .option("checkpointLocation", "<path-to-checkpoint>") \ .start("<path-to-target>")
补充说明:
- 多字符分隔符在Spark 2.4及以上版本原生支持,Databricks全系列运行环境均满足版本要求,无需额外适配。
- 其他常见CSV配置(比如
header指定是否存在表头行、encoding指定文件编码等)都可以用同样的方式直接传入option生效。
内容的提问来源于stack exchange,提问作者Leonardo Lima
相关产品推荐
相关产品推荐

