修复外文特殊字符:还原含HTML转义字符的姓名
批量处理含HTML实体的姓名还原方法
你需要处理的是HTML实体编码的姓名(比如ú对应带重音的ú),以下是两种符合需求的处理方案:
方案1:还原为带重音的原始字符
直接用Python的html模块解码HTML实体即可:
import html # 单个姓名处理 name = "Bulcsú Révész" decoded_name = html.unescape(name) print(decoded_name) # 输出: Bulcsú Révész # 批量处理姓名列表 name_list = ["Bulcsú Révész", "Márta Kovács"] decoded_list = [html.unescape(name) for name in name_list]
方案2:转换为无重音的ASCII字符(匹配你的示例输出)
先解码HTML实体,再用unidecode库去除重音:
- 先安装依赖:
pip install unidecode
- 处理代码:
import html from unidecode import unidecode # 单个姓名处理 name = "Bulcsú Révész" decoded_name = html.unescape(name) ascii_name = unidecode(decoded_name) print(ascii_name) # 输出: Bulcsu Revesz # 批量处理姓名列表 name_list = ["Bulcsú Révész", "Márta Kovács"] processed_list = [unidecode(html.unescape(name)) for name in name_list]
内容的提问来源于stack exchange,提问作者Joe
相关产品推荐
相关产品推荐

