如何用Python3.9的pdfminer提取PDF文本容器的语言标签?
提取PDF文本容器的语言标签问题
我正尝试用Python 3.9提取PDF段落的语言标签,核心需求是检查整个PDF里所有文本容器的语言标签是否一致。
目前用pdfminer库可以提取LTTextBoxHorizontal对象的字体、字号、颜色、坐标等属性,但遍历对象内部始终找不到语言标签相关内容;我已经掌握了获取文件级语言标签的方法,但没办法获取每个文本容器的该属性。想知道Adobe Acrobat是如何获取这类信息的,以及怎么通过代码实现。
分析PDF容器的代码如下:
from pdfminer.high_level import extract_pages, extract_text from pdfminer.layout import LTTextContainer, LTChar, LTRect, LTFigure def extract_paragraph_metadata(pdf_path): for pagenum, page in enumerate(extract_pages(pdf_path)): for element in page: #if element is text if isinstance(element,LTTextContainer): # Function to extract text from the text block d = element.analyze print(d)

内容的提问来源于stack exchange,提问作者mikzielinski
相关产品推荐
相关产品推荐

