You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用PDFMiner.six提取PDF竖排文本并保留单词空格?

关于PDFMiner.six提取竖排文本的问题
  • 使用PDFMiner.six提取PDF中的竖排文本元素时,已设置参数detect_vertical=True, all_texts=True,竖排元素可被检测到,但提取出的文本丢失了单词间的空格,例如结果为:Itisalongestablishedfactthatareaderwillbedistractedbythereadablecontentofapagewhenlookingatits layout.
  • 已尝试两个针对PDFMiner.six竖排文本提取的解决方案,但均无效,其中一个方案的代码如下:
rsrcmgr = PDFResourceManager()
laparams = LAParams(detect_vertical=True, all_texts=True)
device = PDFPageAggregator(rsrcmgr, laparams=laparams)
interpreter = PDFPageInterpreter(rsrcmgr, device)
pages = PDFPage.get_pages(fp)
  • 核心疑问:PDFMiner.six是否能够提取所有PDF文件中的竖排文本?已知Textract可以正确提取,但项目要求必须使用PDFMiner.six。

内容的提问来源于stack exchange,提问作者sal nixon

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 22:05:52