You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用PyPDF2无需重复读写即可拆分扫描书籍类PDF页面

解决PyPDF2拆分扫描PDF时页面裁剪覆盖的问题

我用PyPDF2拆分扫描版书籍的PDF,原PDF每页包含两页书的内容(比如第1页是书的1、2页,第2页是书的3、4页),想把每页拆成两个单独的页面。原来的代码需要先把所有页面复制一遍保存再重新打开裁剪,尝试合并成一步操作时,却出现了裁剪覆盖的问题:拆分后每页都是原页面的右侧内容,左侧裁剪的结果被覆盖了。

问题原因

PyPDF2中的Page对象是引用类型,直接两次调用writer.add_page(reader.pages[i])添加的是同一个页面对象的引用。当你先修改第一个引用的mediabox做左侧裁剪,之后修改第二个引用的mediabox做右侧裁剪时,实际上是在修改同一个对象的属性,最后两个页面都会使用最后一次修改的mediabox设置,也就是右侧裁剪的结果。

解决方案

每次添加页面之前,先使用page.copy()创建页面对象的独立副本,再分别对副本进行左右裁剪,这样两个副本的修改不会互相影响。

修改后的完整代码

# 拆分扫描PDF为单页内容
from PyPDF2 import PdfReader, PdfWriter

reader = PdfReader("mypdf.pdf")
writer = PdfWriter()
number_of_pages = len(reader.pages)
print(f"原PDF页数: {number_of_pages}")

for i in range(number_of_pages):
    original_page = reader.pages[i]
    x, y = original_page.mediabox.getUpperRight_x(), original_page.mediabox.getUpperRight_y()
    
    # 创建左侧页面副本并裁剪
    left_page = original_page.copy()
    left_page.mediabox.lowerLeft = (0, 0)
    left_page.mediabox.upperRight = (x / 2, y)
    writer.add_page(left_page)
    
    # 创建右侧页面副本并裁剪
    right_page = original_page.copy()
    right_page.mediabox.lowerLeft = (x / 2, 0)
    right_page.mediabox.upperRight = (x, y)
    writer.add_page(right_page)

with open("mypdf_splitted.pdf", "wb") as fp:
    writer.write(fp)
print("拆分完成,已保存为mypdf_splitted.pdf")

关键说明

  • 对每个原始页面,调用copy()生成两个独立的副本left_page和right_page
  • 分别修改两个副本的mediabox,实现左右裁剪
  • 把两个裁剪后的副本依次添加到writer中,最终生成的PDF就是按顺序排列的单页内容

内容的提问来源于stack exchange,提问作者andykkkk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.14 03:40:12