You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Auto Loader加载含自定义分隔符CSV数据的配置问题咨询

Databricks Auto Loader的CSV格式兼容原生Spark CSV读取的所有配置参数,你只需要额外添加sep参数指定自定义分隔符即可。

修改后的代码如下:

spark.readStream.format("cloudFiles") \
  .option("cloudFiles.format", "csv") \
  .option("sep", "~|~") \
  # The schema location directory keeps track of your data schema over time
  .option("cloudFiles.schemaLocation", "<path-to-checkpoint>") \
  .load("<path-to-source-data>") \
  .writeStream \
  .option("mergeSchema", "true") \
  .option("checkpointLocation", "<path-to-checkpoint>") \
  .start("<path-to-target>")

补充说明:

  • 多字符分隔符在Spark 2.4及以上版本原生支持,Databricks全系列运行环境均满足版本要求,无需额外适配。
  • 其他常见CSV配置(比如header指定是否存在表头行、encoding指定文件编码等)都可以用同样的方式直接传入option生效。

内容的提问来源于stack exchange,提问作者Leonardo Lima

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 05:57:01