Pandas DataFrame文本编码乱码求助:UTF-8解码无效
Pandas文本乱码修复方案
你的乱码是典型的双重编码问题:原本的UTF-8文本被错误以Latin-1(ISO-8859-1)解码,之后又以UTF-8保存,导致出现ÃÂ这类异常字符。以下是针对性的解决方法:
修复代码
直接将字符串先编码为Latin-1还原原始字节,再用UTF-8解码:
column = 'orgao_nome' df[column] = df[column].str.encode('latin-1').str.decode('utf-8')
关键说明
- 为什么chardet检测结果是UTF-8?因为当前的乱码字符串本身是合法的UTF-8内容,只是它是错误解析后的产物,所以检测工具会识别为UTF-8,但这并非原始文本的编码。
- 执行上述代码后,你的文本会恢复为正常的葡萄牙语:
- SECRETARIA DE FINANÇAS
- RECURSOS ORDINÁRIOS
- IMPOSTOS, TAXAS E CONTRIBUIÇÕES
- INDENIZAÇÕES
内容的提问来源于stack exchange,提问作者Fabio dos Santos
相关产品推荐
相关产品推荐

