You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何通过pdftotext(Poppler/Xpdf版)获取单词的字体信息

获取pdftotext输出中的字体信息(Poppler/Xpdf版本)

好消息是,Poppler版本的pdftotext确实支持输出每个单词的字体信息,包括字体族、样式和大小,但Xpdf版本目前没有这个功能。下面详细说明:

Poppler pdftotext的实现方式

从Poppler 0.80版本开始,pdftotext新增了-bbox-layout参数(注意不是你当前用的-bbox),这个参数会在输出的XML/HTML结构中包含字体相关属性。

使用命令

替换你原来的命令为:

pdftotext -bbox-layout file.pdf output.html

输出示例

你会得到类似这样的带字体信息的标签:

<word xMin="351.852025" yMin="42.548936" xMax="365.689478" yMax="47.681498" font="Verdana" fontsize="9" fontstyle="bold">foo</word>

其中:

  • font字段对应字体族(如Verdana)
  • fontsize是字体大小(如9)
  • fontstyle会标注样式,比如bold(粗体)、italic(斜体)、bolditalic(粗斜体),默认常规样式会显示为normal

Xpdf pdftotext的限制

Xpdf版本的pdftotext目前(截至最新稳定版)没有提供输出字体信息的参数,-bbox参数仅能输出坐标信息,无法获取字体相关属性。如果需要用Xpdf生态获取字体信息,可能需要借助其他工具比如pdfinfo或者直接解析PDF底层结构,但操作复杂度会高很多。

验证你的pdftotext版本

不确定自己用的是哪个版本?可以运行以下命令查看:

pdftotext -v

如果输出里包含poppler字样,就是Poppler版本;如果是Xpdf,则是Xpdf版本。

内容的提问来源于stack exchange,提问作者James Kroning

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 03:33:53