You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Selenium爬取网页时HTML单双引号解析出现乱码该如何解决

乱码问题修复方案

问题根源

该乱码由写入文件时未指定UTF-8编码导致。Python的open()函数在不同操作系统下有不同的默认编码,Windows环境默认使用的编码无法兼容网页中的智能弯引号等特殊Unicode字符,就会出现带问号的菱形乱码。

修复方法

仅需修改打开文件的代码,显式指定编码为UTF-8即可:

with open(os.path.join(os.path.dirname(__file__), path), 'w', encoding='utf-8') as file:
   for paragraph in text[3:]:
       file.write(paragraph.text + '\n')

如果后续需要用Windows系统自带的记事本打开输出的txt文件,可将编码参数替换为encoding='utf-8-sig',写入时会自动添加UTF-8 BOM头,避免记事本识别编码错误。

内容的提问来源于stack exchange,提问作者bringand1

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 13:45:04