You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Python中将指定Windows ANSI编码转UTF-8并输出字节?

非本地代码页ANSI文本转UTF-8的Python实现

问题背景

我有一些采用已知Windows ANSI代码页(如CP936/GBK)编码的文本文件,需要完成:

  • 将其转换为UTF-8编码
  • 输出转换后的UTF-8字节

尝试代码时出现错误:机器默认以CP1252解析输入的\xCE\xD2(实际是GBK编码的“我”),导致转换后得到无意义的结果。期望模拟iconv -f cp936 -t utf-8的效果,最终输出我;e68891。

解决方案

核心逻辑是跳过系统默认编码干扰,按「源编码字节→Unicode字符串→UTF-8字节」的流程完成转换。

1. 处理内存中的字节数据

若直接持有字节序列,需先以正确的源编码解码为字符串,再编码为UTF-8:

# 原始GBK编码的字节(对应"我")
china_ansi_bytes = b'\xCE\xD2'
# 用CP936解码为Unicode字符串
chinese_str = china_ansi_bytes.decode('cp936')
# 编码为UTF-8字节
utf8_bytes = chinese_str.encode('utf-8')
# 输出期望格式
print(f"{chinese_str};{utf8_bytes.hex()}")

运行结果:

我;e68891

2. 处理本地文本文件

直接指定源编码读取文件,再以UTF-8编码写入,完全等价于iconv命令效果:

# 读取CP936编码的输入文件
with open('input.txt', 'r', encoding='cp936') as f_in:
    content = f_in.read()
# 写入UTF-8编码的输出文件
with open('output.txt', 'w', encoding='utf-8') as f_out:
    f_out.write(content)

关键注意事项

  • 避免直接对被系统默认编码错误解析的字符串进行二次编码,必须从原始字节数据开始处理。
  • Python字符串本质是Unicode编码的中间载体,编码转换必须经过这个中间层,不能直接在不同字节编码间跳转。

内容的提问来源于stack exchange,提问作者MyICQ

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 23:22:15