You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Python提取PDF文件中的下划线标注文本

从PDF中提取下划线标注文本的解决方案

下面提供两种可直接落地的操作方案,按需选择即可:

方案1:Python脚本批量处理(适合大量PDF提取场景)

  • 先安装依赖库:pip install pymupdf
  • 核心逻辑:PDF中的原生下划线属于注释类对象,可直接匹配下划线坐标对应的文本内容,示例代码如下:
import fitz

def extract_underlined_text(pdf_path):
    doc = fitz.open(pdf_path)
    result = []
    for page in doc:
        # 提取页面所有下划线注释
        annots = page.annots()
        for annot in annots:
            if annot.type[0] == 8: # 8对应下划线类型注释
                # 获取下划线所在的坐标范围
                rect = annot.rect
                # 提取坐标范围内的文本
                text = page.get_text("text", clip=rect).strip()
                if text:
                    result.append(text)
    return result

# 调用示例
underlined_texts = extract_underlined_text("你的文件路径.pdf")
print(underlined_texts) # 输出所有下划线标注的文本,比如Python、Git、GitHub都会出现在列表里
  • 如果你的PDF是扫描件或者下划线是后期手绘的非原生注释,可额外引入pytesseract做OCR识别,匹配下划线线段坐标对应的文本区域即可。

方案2:桌面工具快速处理(适合少量单文件提取场景)

  • 用Adobe Acrobat Pro:打开PDF后按下Ctrl+Shift+F调出高级搜索面板,在搜索选项中勾选「包含注释」,筛选下划线注释关联的文本即可批量导出。
  • 用WPS PDF:打开PDF后点击左侧边栏的「注释」按钮,筛选「下划线」类型的注释,所有带下划线的文本会直接罗列出来,直接复制即可。

内容的提问来源于stack exchange,提问作者kiro

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 06:09:03