You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark使用sc.textFile无法正确解码ISO-8859-1编码文件

解决PySpark读取ISO-8859-1编码、多字符分隔符CSV的乱码问题

你的问题根源很清晰:sc.textFile默认以UTF-8编码读取文件,但你的数据源是ISO-8859-1(Latin-1)编码,导致葡语特殊字符(比如Ô、Ç、é)解码失败出现乱码;同时因为用了多字符分隔符@|,PySpark原生的read.csv不支持这种格式,得换个方式处理。

这里给你调整后的代码,能完美解决编码和分隔符的问题:

df_x = (spark.read.text(path, encoding='ISO-8859-1')
        .rdd
        .map(lambda row: row.value.replace("\t", "").split("@|"))
        .toDF(schema=config["report"]["schema"]))

关键调整说明:

  • 用spark.read.text()替代sc.textFile():这个API支持通过encoding参数直接指定文件编码,这里设置为ISO-8859-1(也可以写'Latin-1',两者完全等价),确保特殊字符被正确解码。
  • 后续处理逻辑和你原来的保持一致:先移除制表符,再按@|拆分每行数据,最后转换为带指定Schema的DataFrame。

这样处理后,你就能得到期望的输出:

R. GERALDO RODRIGUES DA SILVA 112 RUA ANTÔNIO GONÇALVES FILHO 91 José Gonçalves Borges 391 SALDANHA MARINHO 522

内容的提问来源于stack exchange,提问作者Lucas Mascia

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.07 10:43:10