You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Python提取PDF版本时遇UnicodeDecodeError错误求助

解决PDF版本提取时的UnicodeDecodeError问题
  • 错误原因:你调用decode()时默认使用UTF-8编码,但PDF文件流里可能包含非UTF-8字节(比如报错里的0xe2),导致解码失败。其实PDF的版本标识行是ASCII兼容的,用单字节编码(比如Latin-1)就能正确解析,不会出现解码错误。

  • 修改原代码的解决办法:把decode()指定为decode('latin-1'),代码如下:

from PyPDF2 import PdfReader
doc = PdfReader(filepath)
doc.stream.seek(0) # 重置流到文件开头
print(doc.stream.readline().decode('latin-1'))
  • 更靠谱的替代方案:不用PyPDF2,直接读取文件开头内容。毕竟PDF版本就在首行,这种方式更直接且不容易出问题:
with open(filepath, 'rb') as pdf_file:
    first_line = pdf_file.readline().decode('latin-1').strip()
    if first_line.startswith('%PDF-'):
        print(first_line)

内容的提问来源于stack exchange,提问作者Neil

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.22 19:13:09