如何在Pandas Series中反转义HTML实体?
解决方案
出现这种情况大概率是文本被双重HTML编码了:原始内容中的ã先被编码为ã,之后整个ã又被编码为ã(最终显示为ã)。此时单次html.unescape只能解码外层的&,无法处理内层的转义。
解决办法是执行两次HTML解码:
import html import pandas as pd # 两次unescape处理双重编码 df_abertura['Descricao'] = df_abertura['Descricao'].apply(lambda x: html.unescape(html.unescape(x)))
验证步骤
可以先打印原始字符串的原始表示,确认是否存在双重编码:
# 查看第一个元素的原始字符串结构 print(repr(df_abertura['Descricao'].iloc[0]))
如果输出结果包含ã,则说明确实是双重编码问题,上述方案即可解决。
内容的提问来源于stack exchange,提问作者André Sabino
相关产品推荐
相关产品推荐

