You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何解决CSV文本数据中因编码异常导致的乱码字符转换问题

问题原因

该字符损坏为典型的编码不匹配错误:

  • 原始CSV文件为UTF-8编码,特殊字符á的UTF-8字节序列为\xc3\xa1,ñ的UTF-8字节序列为\xc3\xb1
  • 文件读取阶段错误使用了单字节编码(如Latin-1、CP1252等)解析UTF-8字节,每个字节被单独映射为错误字符,最终呈现为你看到的ГЎ、Г±类乱码。
修复方法

批量代码修复(Python示例)

对已经读入的乱码文本,执行编码回退+重新解码即可还原:

# 乱码文本示例
wrong_text = "Indie EspaГ±ol"
# 修复逻辑:先按单字节编码转回到原始字节,再用UTF-8正常解码
correct_text = wrong_text.encode("latin-1").decode("utf-8")
print(correct_text) # 输出结果:Indie Español

读取CSV阶段即可避免该问题,打开文件时主动指定UTF-8编码:

import csv
with open("你的文件路径.csv", mode="r", encoding="utf-8") as f:
    csv_reader = csv.reader(f)
    for row in csv_reader:
        # 直接拿到无乱码的行内容
        print(row)

通用修复逻辑

所有工具场景下都可以按照该逻辑处理:

  • 将现有乱码文本按单字节Latin-1编码转换为原始字节序列
  • 用UTF-8编码重新解析该字节序列,即可得到正确文本

内容的提问来源于stack exchange,提问作者Notsogenius

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 23:45:03