You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas Series中反转义HTML实体?

解决方案

出现这种情况大概率是文本被双重HTML编码了:原始内容中的ã先被编码为ã,之后整个ã又被编码为ã(最终显示为ã)。此时单次html.unescape只能解码外层的&,无法处理内层的转义。

解决办法是执行两次HTML解码:

import html
import pandas as pd

# 两次unescape处理双重编码
df_abertura['Descricao'] = df_abertura['Descricao'].apply(lambda x: html.unescape(html.unescape(x)))

验证步骤

可以先打印原始字符串的原始表示,确认是否存在双重编码:

# 查看第一个元素的原始字符串结构
print(repr(df_abertura['Descricao'].iloc[0]))

如果输出结果包含ã,则说明确实是双重编码问题,上述方案即可解决。


内容的提问来源于stack exchange,提问作者André Sabino

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.18 20:12:47