Python3中如何将含转义字符的ASCII原始字符串转为标准Unicode字符串?
Python 3:含转义字符的ASCII原始字符串转Unicode字符串
问题场景
我们需要将形如 r'\xc3\xa4' 的ASCII原始字符串(包含十六进制转义序列),转换为对应的标准Unicode字符串(比如 "ä")。示例如下:
a = "ä" # 目标Unicode字符串(带元音变音符号) b = bytearray(a, "utf8") # 转换为UTF-8字节序列:bytearray(b'\xc3\xa4') s = r'\xc3\xa4' # 待转换的原始ASCII字符串
目标是实现函数 F,满足 a == F(s)。尝试过 a == s.encode('latin-1').decode('unicode-escape') 但返回 False,需要找到正确的转换逻辑。
解决方案
核心思路
之前的方法失败原因是:unicode-escape 解码后得到的是Unicode字符序列(每个转义对应一个Unicode码点),而非UTF-8字节序列。正确的转换需要分三步:
- 解析原始字符串的转义序列,得到对应字节值的Unicode字符
- 将这些Unicode字符映射为字节序列
- 用UTF-8解码字节序列,得到目标Unicode字符串
实现代码
def convert_raw_to_unicode(s): # 1. 解析转义序列,得到对应字节值的Unicode字符 escaped_str = s.encode('latin-1').decode('unicode-escape') # 2. 将Unicode字符转成UTF-8字节序列(latin-1单字节映射) utf8_bytes = escaped_str.encode('latin-1') # 3. UTF-8解码得到目标字符串 return utf8_bytes.decode('utf-8') # 测试验证 a = "ä" s = r'\xc3\xa4' print(a == convert_raw_to_unicode(s)) # 输出:True
也可以简化为一行代码:
convert_raw_to_unicode = lambda s: s.encode('latin-1').decode('unicode-escape').encode('latin-1').decode('utf-8')
逻辑说明
s.encode('latin-1'):将原始ASCII字符串转成字节序列(latin-1编码不改变字符,直接映射).decode('unicode-escape'):解析转义序列,得到包含字节值的Unicode字符串(比如'\xc3\xa4',每个字符对应一个字节的数值).encode('latin-1'):将Unicode字符转成真实的字节序列b'\xc3\xa4'(latin-1保证0-255的Unicode码点与字节一一对应).decode('utf-8'):用UTF-8解码字节序列,最终得到目标Unicode字符串"ä"
内容的提问来源于stack exchange,提问作者IronPillow2
相关产品推荐
相关产品推荐

