使用iText7 for C#读取PDF时项目符号无法正常识别的求助
PDF项目符号识别异常的原因分析
项目符号为图形元素而非文本
不少PDF里的项目符号(如实心圆点、方形符号)是用矢量图形绘制的,并非可被文本提取策略识别的文本字符。你用的SimpleTextExtractionStrategy仅能提取文本内容,对这类图形化的项目符号完全无法识别,自然不会显示。字体或编码问题
如果项目符号是Unicode特殊字符(比如U+2022圆点符号),但PDF未正确嵌入对应的字体文件,或者iText解析时无法匹配该字符的编码映射,就会出现无法解码的情况,最终显示为?。本质是字符的字形数据缺失或编码映射错误,导致提取时无法转换为可读字符。基础提取策略的局限性
SimpleTextExtractionStrategy是最基础的文本提取策略,仅按PDF内部的文本绘制顺序提取内容。对于一些排版特殊的项目符号(比如和对应文本不在同一个文本块、位置偏移较大),这个策略可能无法将项目符号与文本关联,甚至直接遗漏。
内容的提问来源于stack exchange,提问作者futium
相关产品推荐
相关产品推荐

