如何保留谷歌翻译PDF中叠加译文的位置与页码?
保留谷歌翻译PDF叠加译文的位置与页码信息的方法
利用poppler套件的pdftotext带参数提取
默认pdftotext仅输出纯文本,添加特定参数可保留位置和页码信息:
- 执行命令:
pdftotext -bbox-layout text_output_from_google_translate.pdf output_with_positions.txt-bbox-layout参数会为每个文本块添加边界框坐标(左下角X/Y、右上角X/Y),文本按页码分段,能直接对应原PDF的页码和译文位置。输出的TXT文件中,坐标标记与文本绑定,可清晰还原译文在页面的大致位置。
用pdftohtml(poppler套件)生成带位置的可视化文件
若需要更直观的位置展示,可使用同属poppler的pdftohtml:
- 执行命令:
pdftohtml -noframes text_output_from_google_translate.pdf output_with_positions.html-noframes参数生成无框架的HTML文件,每个译文文本元素会通过style属性标注绝对位置,HTML内会按页码区分内容,可直接在浏览器中查看译文与原页面位置的对应关系,也便于后续二次处理。
借助mupdf套件的mutool提取结构化数据
如果需要便于程序解析的结构化格式,可使用mupdf的mutool工具:
- 执行命令:
mutool extract -f json text_output_from_google_translate.pdf > output_with_positions.json- 输出的JSON文件会按页码划分内容,每个文本块包含
bbox(边界框坐标)和text(译文内容)字段,精准对应译文的页码和位置信息,适合后续脚本处理或数据提取。
- 输出的JSON文件会按页码划分内容,每个文本块包含
内容的提问来源于stack exchange,提问作者revher
相关产品推荐
相关产品推荐

