如何使用Python提取PDF文件中的下划线标注文本
从PDF中提取下划线标注文本的解决方案
下面提供两种可直接落地的操作方案,按需选择即可:
方案1:Python脚本批量处理(适合大量PDF提取场景)
- 先安装依赖库:
pip install pymupdf - 核心逻辑:PDF中的原生下划线属于注释类对象,可直接匹配下划线坐标对应的文本内容,示例代码如下:
import fitz def extract_underlined_text(pdf_path): doc = fitz.open(pdf_path) result = [] for page in doc: # 提取页面所有下划线注释 annots = page.annots() for annot in annots: if annot.type[0] == 8: # 8对应下划线类型注释 # 获取下划线所在的坐标范围 rect = annot.rect # 提取坐标范围内的文本 text = page.get_text("text", clip=rect).strip() if text: result.append(text) return result # 调用示例 underlined_texts = extract_underlined_text("你的文件路径.pdf") print(underlined_texts) # 输出所有下划线标注的文本,比如Python、Git、GitHub都会出现在列表里
- 如果你的PDF是扫描件或者下划线是后期手绘的非原生注释,可额外引入
pytesseract做OCR识别,匹配下划线线段坐标对应的文本区域即可。
方案2:桌面工具快速处理(适合少量单文件提取场景)
- 用Adobe Acrobat Pro:打开PDF后按下
Ctrl+Shift+F调出高级搜索面板,在搜索选项中勾选「包含注释」,筛选下划线注释关联的文本即可批量导出。 - 用WPS PDF:打开PDF后点击左侧边栏的「注释」按钮,筛选「下划线」类型的注释,所有带下划线的文本会直接罗列出来,直接复制即可。
内容的提问来源于stack exchange,提问作者kiro
相关产品推荐
相关产品推荐

