You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何保留谷歌翻译PDF中叠加译文的位置与页码?

保留谷歌翻译PDF叠加译文的位置与页码信息的方法

利用poppler套件的pdftotext带参数提取

默认pdftotext仅输出纯文本,添加特定参数可保留位置和页码信息:

  • 执行命令:pdftotext -bbox-layout text_output_from_google_translate.pdf output_with_positions.txt
    • -bbox-layout参数会为每个文本块添加边界框坐标(左下角X/Y、右上角X/Y),文本按页码分段,能直接对应原PDF的页码和译文位置。输出的TXT文件中,坐标标记与文本绑定,可清晰还原译文在页面的大致位置。

用pdftohtml(poppler套件)生成带位置的可视化文件

若需要更直观的位置展示,可使用同属poppler的pdftohtml:

  • 执行命令:pdftohtml -noframes text_output_from_google_translate.pdf output_with_positions.html
    • -noframes参数生成无框架的HTML文件,每个译文文本元素会通过style属性标注绝对位置,HTML内会按页码区分内容,可直接在浏览器中查看译文与原页面位置的对应关系,也便于后续二次处理。

借助mupdf套件的mutool提取结构化数据

如果需要便于程序解析的结构化格式,可使用mupdf的mutool工具:

  • 执行命令:mutool extract -f json text_output_from_google_translate.pdf > output_with_positions.json
    • 输出的JSON文件会按页码划分内容,每个文本块包含bbox(边界框坐标)和text(译文内容)字段,精准对应译文的页码和位置信息,适合后续脚本处理或数据提取。

内容的提问来源于stack exchange,提问作者revher

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.28 16:33:13