You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何移除扫描PDF中的图片,仅保留按页组织的OCR文本?

移除PDF扫描图片并保留OCR文本的工具推荐

Python工具(适配你的后续脚本工作流)

PyMuPDF(fitz)

PyMuPDF是轻量高效的PDF处理Python库,可精准操作PDF页面元素,轻松移除图片并保留按页面组织的OCR文本。

示例脚本:

import fitz  # 导入PyMuPDF库

def remove_pdf_images(input_pdf, output_pdf):
    doc = fitz.open(input_pdf)
    for page in doc:
        # 获取页面所有图片引用
        image_refs = page.get_images(full=True)
        # 遍历移除每张图片
        for img_ref in image_refs:
            page.delete_image(img_ref[0])
    # 保存处理后的PDF
    doc.save(output_pdf)
    doc.close()

# 使用示例
remove_pdf_images("带扫描图的OCR文档.pdf", "仅保留OCR文本.pdf")

该脚本会遍历PDF每一页,删除所有图片元素,严格保留原始页面的文本结构与顺序,完全适配后续Python脚本处理需求。

命令行工具(适合批量快速处理)

Ghostscript

Ghostscript是老牌PDF处理工具,通过命令行即可快速过滤PDF中的图片,仅保留文本内容。

执行命令:

gs -sDEVICE=pdfwrite -dFILTERIMAGE -dNOPAUSE -dBATCH -sOutputFile=仅保留OCR文本.pdf 带扫描图的OCR文档.pdf
  • -dFILTERIMAGE 参数会过滤所有图片元素,仅保留文本
  • 处理后的PDF将维持原页面组织形式,不会打乱OCR文本的页面归属

内容的提问来源于stack exchange,提问作者Colin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.08 04:42:07