You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何获取PDF字符/单词/行/块坐标?pdftotext工具功能咨询

关于pdftotext不同层级坐标输出的支持情况

好问题!我自己平时处理PDF文本坐标的时候也研究过poppler和xpdf版本的pdftotext差异,下面给你详细梳理:

Poppler版本的pdftotext

Poppler的pdftotext功能相对丰富,完全支持你提到的多层级坐标输出需求:

  • 字符级坐标:使用-bbox-layout参数,这个参数会输出每个字符的边界框信息,同时附带行、块的结构标记。输出内容里每个字符都会单独对应一行包含坐标的记录,非常细致。
  • 行级/块级坐标:同样依赖-bbox-layout参数,它会在输出中加入Line和Block开头的行,分别对应每一行文本和每个文本块(比如段落、独立文本区域)的边界框坐标。
  • 短语级坐标:pdftotext没有直接的参数输出“短语”级坐标(毕竟短语的定义太灵活,没有统一标准),不过你可以基于单词级或字符级的坐标数据,通过判断文本的位置连续性、间距等规则,自行合并出符合需求的短语坐标。

Xpdf版本的pdftotext

Xpdf的命令行pdftotext功能相对局限一些:

  • 仅支持单词级坐标:也就是你正在用的-bbox参数,只能输出每个单词的边界框。
  • 字符/行/块级坐标:命令行工具本身没有直接支持的参数,如果需要这些层级的坐标,你可能需要借助Xpdf的底层API进行自定义开发,或者搭配其他工具间接处理。

小提示

如果你还没确认自己用的是哪个版本,直接运行pdftotext -v就能看到版本信息——一般Linux发行版默认带的是Poppler版本,而一些旧环境或特定工具链里可能是Xpdf版本。

内容的提问来源于stack exchange,提问作者James Kroning

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 03:33:51