如何移除扫描PDF中的图片,仅保留按页组织的OCR文本?
移除PDF扫描图片并保留OCR文本的工具推荐
Python工具(适配你的后续脚本工作流)
PyMuPDF(fitz)
PyMuPDF是轻量高效的PDF处理Python库,可精准操作PDF页面元素,轻松移除图片并保留按页面组织的OCR文本。
示例脚本:
import fitz # 导入PyMuPDF库 def remove_pdf_images(input_pdf, output_pdf): doc = fitz.open(input_pdf) for page in doc: # 获取页面所有图片引用 image_refs = page.get_images(full=True) # 遍历移除每张图片 for img_ref in image_refs: page.delete_image(img_ref[0]) # 保存处理后的PDF doc.save(output_pdf) doc.close() # 使用示例 remove_pdf_images("带扫描图的OCR文档.pdf", "仅保留OCR文本.pdf")
该脚本会遍历PDF每一页,删除所有图片元素,严格保留原始页面的文本结构与顺序,完全适配后续Python脚本处理需求。
命令行工具(适合批量快速处理)
Ghostscript
Ghostscript是老牌PDF处理工具,通过命令行即可快速过滤PDF中的图片,仅保留文本内容。
执行命令:
gs -sDEVICE=pdfwrite -dFILTERIMAGE -dNOPAUSE -dBATCH -sOutputFile=仅保留OCR文本.pdf 带扫描图的OCR文档.pdf
-dFILTERIMAGE参数会过滤所有图片元素,仅保留文本- 处理后的PDF将维持原页面组织形式,不会打乱OCR文本的页面归属
内容的提问来源于stack exchange,提问作者Colin
相关产品推荐
相关产品推荐

