使用Python提取PDF版本时遇UnicodeDecodeError错误求助
解决PDF版本提取时的UnicodeDecodeError问题
错误原因:你调用
decode()时默认使用UTF-8编码,但PDF文件流里可能包含非UTF-8字节(比如报错里的0xe2),导致解码失败。其实PDF的版本标识行是ASCII兼容的,用单字节编码(比如Latin-1)就能正确解析,不会出现解码错误。修改原代码的解决办法:把
decode()指定为decode('latin-1'),代码如下:
from PyPDF2 import PdfReader doc = PdfReader(filepath) doc.stream.seek(0) # 重置流到文件开头 print(doc.stream.readline().decode('latin-1'))
- 更靠谱的替代方案:不用PyPDF2,直接读取文件开头内容。毕竟PDF版本就在首行,这种方式更直接且不容易出问题:
with open(filepath, 'rb') as pdf_file: first_line = pdf_file.readline().decode('latin-1').strip() if first_line.startswith('%PDF-'): print(first_line)
内容的提问来源于stack exchange,提问作者Neil
相关产品推荐
相关产品推荐

