如何用Python解码PDF文件文本?解析PDF TJ操作符及内容类型
PDF文本指令解析与问题解答
一、逐行理解PDF内容
BT:开始文本块,标记后续指令用于文本绘制/F2 8.8 Tf:设置文本字体与字号,/F2是文档内定义的字体ID,8.8为字号,Tf是字体设置操作符1 0 0 1 36.85 738.3 Tm:设置文本矩阵,前四个参数表示无缩放、旋转,后两个数值36.85 738.3是文本绘制的起始坐标(PDF坐标系原点在页面左下角)0 g:设置文本填充色为黑色,g是填充色操作符0 G:设置文本描边色为黑色,G是描边色操作符(此处文本无需描边,与填充色一致)[(A)31(c)-44(c)-44(o)-79(u)11(n)-79(t)5( )] TJ:执行文本绘制,TJ是文本显示操作符ET:结束文本块
二、文本数组的类型说明
[(A)31(c)-44(c)-44(o)-79(u)11(n)-79(t)5( )] 是PDF中的文本显示数组,属于PDF数组类型,专门配合TJ操作符使用:
- 数组元素分为两类:带括号的字符串(如
(A)、(c))代表要显示的字符;数字(如31、-44)是字距调整值,单位为千分之一字号,正数增加字符间距,负数缩小间距 - 按规则计算后,这段数组最终会显示文本:
Account(末尾含空格)
内容的提问来源于stack exchange,提问作者arvind kumar
相关产品推荐
相关产品推荐

