如何使用PyPDF2无需重复读写即可拆分扫描书籍类PDF页面
解决PyPDF2拆分扫描PDF时页面裁剪覆盖的问题
我用PyPDF2拆分扫描版书籍的PDF,原PDF每页包含两页书的内容(比如第1页是书的1、2页,第2页是书的3、4页),想把每页拆成两个单独的页面。原来的代码需要先把所有页面复制一遍保存再重新打开裁剪,尝试合并成一步操作时,却出现了裁剪覆盖的问题:拆分后每页都是原页面的右侧内容,左侧裁剪的结果被覆盖了。
问题原因
PyPDF2中的Page对象是引用类型,直接两次调用writer.add_page(reader.pages[i])添加的是同一个页面对象的引用。当你先修改第一个引用的mediabox做左侧裁剪,之后修改第二个引用的mediabox做右侧裁剪时,实际上是在修改同一个对象的属性,最后两个页面都会使用最后一次修改的mediabox设置,也就是右侧裁剪的结果。
解决方案
每次添加页面之前,先使用page.copy()创建页面对象的独立副本,再分别对副本进行左右裁剪,这样两个副本的修改不会互相影响。
修改后的完整代码
# 拆分扫描PDF为单页内容 from PyPDF2 import PdfReader, PdfWriter reader = PdfReader("mypdf.pdf") writer = PdfWriter() number_of_pages = len(reader.pages) print(f"原PDF页数: {number_of_pages}") for i in range(number_of_pages): original_page = reader.pages[i] x, y = original_page.mediabox.getUpperRight_x(), original_page.mediabox.getUpperRight_y() # 创建左侧页面副本并裁剪 left_page = original_page.copy() left_page.mediabox.lowerLeft = (0, 0) left_page.mediabox.upperRight = (x / 2, y) writer.add_page(left_page) # 创建右侧页面副本并裁剪 right_page = original_page.copy() right_page.mediabox.lowerLeft = (x / 2, 0) right_page.mediabox.upperRight = (x, y) writer.add_page(right_page) with open("mypdf_splitted.pdf", "wb") as fp: writer.write(fp) print("拆分完成,已保存为mypdf_splitted.pdf")
关键说明
- 对每个原始页面,调用
copy()生成两个独立的副本left_page和right_page - 分别修改两个副本的mediabox,实现左右裁剪
- 把两个裁剪后的副本依次添加到writer中,最终生成的PDF就是按顺序排列的单页内容
内容的提问来源于stack exchange,提问作者andykkkk
相关产品推荐
相关产品推荐

