You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用PyPDF2读取英文PDF出现乱码,如何正确提取文本?

PDF文本提取乱码问题的解决办法

问题背景

使用PyPDF2(或pypdf)提取特定PDF第41页文本时出现乱码,执行代码如下:

pageObj = PyPDF2.PdfReader(open(path_to_the_file, 'rb')).pages  # 创建PDF读取对象
page_41 = pageObj[40].extract_text()

提取得到的乱码内容示例:

䩯桮⁈慮捯捫⁕十 䱩晥獴祬攠䅧杲敳獩癥 102,734
䩯桮⁈慮捯捫⁕十 䱩晥獴祬攠䝲潷瑨 159,791
䩯桮⁈慮捯捫⁕十 䱩晥獴祬攠䉡污湣敤 285,623
䩯桮⁈慮捯捫⁕十 䱩晥獴祬攠䵯摥牡瑥 9,130
䩯桮⁈慮捯捫⁕十 䱩晥獴祬攠䍯湳敲癡瑩癥 ㌰ⰶ㔰

这类乱码问题约在5%的PDF文件中出现,经测试切换至PyMuPDF库后可正常提取文本,确认问题源于PyPDF系列库的兼容性缺陷。

可行解决方案

1. 替换为PyMuPDF(fitz)提取文本

PyMuPDF对复杂PDF的字体编码解析、字符映射支持更完善,是解决此类问题的最优方案,示例代码:

import fitz

# 打开目标PDF
doc = fitz.open(path_to_the_file)
# 获取第41页(索引从0开始)
target_page = doc[40]
# 提取页面文本
page_41_text = target_page.get_text()
# 关闭文档
doc.close()

2. PyPDF系列库的临时修复方案(仅部分场景有效)

若因需求限制必须使用PyPDF系列库,可尝试以下操作:

  • 升级至最新版本:执行pip install --upgrade pypdf,新版本可能修复了部分编码兼容问题
  • 指定提取编码:尝试在extract_text()中手动指定编码(如extract_text(encoding='utf-8')),但仅能解决少数简单编码异常场景

问题根源

PyPDF系列库在处理嵌入非标准字体、自定义字符编码映射的PDF时,无法正确建立字体与字符的对应关系,导致提取出的文本显示为乱码;而PyMuPDF的文本提取引擎对这类复杂PDF的兼容性更强,可准确识别并解析字体编码规则。

内容的提问来源于stack exchange,提问作者John s

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.30 10:52:37