如何用PDFMiner.six提取PDF竖排文本并保留单词空格?
关于PDFMiner.six提取竖排文本的问题
- 使用PDFMiner.six提取PDF中的竖排文本元素时,已设置参数
detect_vertical=True, all_texts=True,竖排元素可被检测到,但提取出的文本丢失了单词间的空格,例如结果为:Itisalongestablishedfactthatareaderwillbedistractedbythereadablecontentofapagewhenlookingatits layout. - 已尝试两个针对PDFMiner.six竖排文本提取的解决方案,但均无效,其中一个方案的代码如下:
rsrcmgr = PDFResourceManager() laparams = LAParams(detect_vertical=True, all_texts=True) device = PDFPageAggregator(rsrcmgr, laparams=laparams) interpreter = PDFPageInterpreter(rsrcmgr, device) pages = PDFPage.get_pages(fp)
- 核心疑问:PDFMiner.six是否能够提取所有PDF文件中的竖排文本?已知Textract可以正确提取,但项目要求必须使用PDFMiner.six。
内容的提问来源于stack exchange,提问作者sal nixon
相关产品推荐
相关产品推荐

