如何配置Spark正确读取含特殊标记分隔符的CSV文件
问题解答
只修改delimiter=';'参数无法解决这个问题,原因是你的CSV文件采用了非标准的特殊字符标记规则——用";"来表示字段内部的;,而Spark的CSV读取器默认遵循标准CSV规范(用双引号包裹整个包含特殊分隔符的字段,比如"foo;bar"),单纯调整分隔符参数无法识别这种自定义的标记逻辑。
可行解决方案
既然无法修改原文件,你可以通过以下两种方式处理:
1. 自定义行解析逻辑(最可靠)
先按文本行读取整个文件,替换掉标记用的";"为普通;,再分割列转换为结构化DataFrame:
# 读取原始文本文件 text_df = spark.read.text("path\\to\\file") # 导入所需函数 from pyspark.sql.functions import split, regexp_replace, col # 替换自定义标记的";"为普通分号 processed_df = text_df.withColumn("processed_line", regexp_replace(col("value"), '";"', ';')) # 分割每行数据为列 split_df = processed_df.withColumn("cols", split(col("processed_line"), ';')) # 提取表头信息 header_row = split_df.filter(col("value").startswith("c1")).select("cols").first()[0] # 筛选数据行并转换为结构化DataFrame final_df = split_df.filter(~col("value").startswith("c1")).select( *[col("cols")[i].alias(header_row[i]) for i in range(len(header_row))] ) # 转换字段数据类型(根据实际需求调整) final_df = final_df.withColumn("c1", col("c1").cast("int")).withColumn("c3", col("c3").cast("int")) final_df.show()
2. 尝试调整Spark CSV的引号/转义参数(适配性有限)
虽然你的文件格式非标准,但可以尝试通过设置quote和escape参数尝试适配:
spark.read.options( delimiter=';', header=True, inferSchema=True, quote='"', # 指定引号字符 escape='"' # 指定转义字符 ).csv('path\\to\\file')
不过这种方式大概率无法完全匹配你的自定义规则,仅作为备选尝试。
内容的提问来源于stack exchange,提问作者Duccio Borchi
相关产品推荐
相关产品推荐

