You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spark读取含双引号的CSV文件时字段解析异常问题求助

Spark读取含双引号的CSV文件时字段解析异常问题求助

Hey 大家好,我最近在使用Spark读取CSV文件时碰到了一个字段解析的棘手问题,试了各种quote相关的配置都没解决,想请大家帮忙看看!

我的CSV文件用分号;作为分隔符,一共有5个字段:Name、LastName、Address、PhoneNumber、Gender。其中有一行数据的Address字段开头带了个双引号但没有闭合,具体数据如下:

John;Cenna;"main street;369526544;male

我当前使用的读取代码是:

df = spark.read.option("delimiter", ";").csv(path, header=False, inferSchema=False)

但Spark把这行数据解析成了错误的结果:

Name = John
LastName = Cenna
Address = "main street;369526544;male
PhoneNumber = null
Gender = null

而我期望的正确解析结果应该是:

Name = John
LastName = Cenna
Address = "main street
PhoneNumber = 369526544
Gender = male

我已经尝试调整过quote、quoteAll、escape、escapeQuotes这些参数,但都没能修正解析错误,目前只有delimiter这个参数是确定设置正确的。有没有大佬知道该怎么配置才能让Spark正确解析这行数据呀?

备注:内容来源于stack exchange,提问作者Javier Sevillano

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.14 14:14:30