You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas DataFrame文本编码乱码求助:UTF-8解码无效

Pandas文本乱码修复方案

你的乱码是典型的双重编码问题:原本的UTF-8文本被错误以Latin-1(ISO-8859-1)解码,之后又以UTF-8保存,导致出现ÃÂ这类异常字符。以下是针对性的解决方法:

修复代码

直接将字符串先编码为Latin-1还原原始字节,再用UTF-8解码:

column = 'orgao_nome'
df[column] = df[column].str.encode('latin-1').str.decode('utf-8')

关键说明

  • 为什么chardet检测结果是UTF-8?因为当前的乱码字符串本身是合法的UTF-8内容,只是它是错误解析后的产物,所以检测工具会识别为UTF-8,但这并非原始文本的编码。
  • 执行上述代码后,你的文本会恢复为正常的葡萄牙语:
    • SECRETARIA DE FINANÇAS
    • RECURSOS ORDINÁRIOS
    • IMPOSTOS, TAXAS E CONTRIBUIÇÕES
    • INDENIZAÇÕES

内容的提问来源于stack exchange,提问作者Fabio dos Santos

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.11 16:42:03