Spark读取含双引号的CSV文件时字段解析异常问题求助
Spark读取含双引号的CSV文件时字段解析异常问题求助
Hey 大家好,我最近在使用Spark读取CSV文件时碰到了一个字段解析的棘手问题,试了各种quote相关的配置都没解决,想请大家帮忙看看!
我的CSV文件用分号;作为分隔符,一共有5个字段:Name、LastName、Address、PhoneNumber、Gender。其中有一行数据的Address字段开头带了个双引号但没有闭合,具体数据如下:
John;Cenna;"main street;369526544;male
我当前使用的读取代码是:
df = spark.read.option("delimiter", ";").csv(path, header=False, inferSchema=False)
但Spark把这行数据解析成了错误的结果:
Name = John LastName = Cenna Address = "main street;369526544;male PhoneNumber = null Gender = null
而我期望的正确解析结果应该是:
Name = John LastName = Cenna Address = "main street PhoneNumber = 369526544 Gender = male
我已经尝试调整过quote、quoteAll、escape、escapeQuotes这些参数,但都没能修正解析错误,目前只有delimiter这个参数是确定设置正确的。有没有大佬知道该怎么配置才能让Spark正确解析这行数据呀?
备注:内容来源于stack exchange,提问作者Javier Sevillano
相关产品推荐
相关产品推荐

