关于Tagged PDF中HyphenSpan的JAWS读取差异与内容流的关联确认
JAWS读取PDF连字符差异与内容流的关联分析
这种读取差异确实和PDF的内容流(content stream)及相关结构细节直接相关,核心原因可以从以下几点拆解:
内容流的字符语义定义差异:
两份PDF虽都标记了Hyphen Span,但内容流中对连字符的实际定义可能不同:- 读取为
December的PDF,内容流里的连字符是**软连字符(soft hyphen)**的排版表现,仅用于单词断行,无独立字符语义,JAWS结合Hyphen Span的断行标记会自动拼接断行的单词; - 读取为
De dash cember的PDF,内容流里的连字符被渲染为实体破折号字符,即使有Hyphen Span标签,JAWS会优先识别内容流中的字符实体,将其作为独立元素读出。
- 读取为
标签与内容流的绑定逻辑:
JAWS读取PDF时会同时参考标签结构和内容流的文本内容。若其中一份PDF的Hyphen Span标签与内容流中的软连字符语义强绑定,JAWS会触发断行单词的合并规则;另一份若标签仅关联了可见的破折号字符,未和前后文本形成语义关联,就会被独立读取。内容流的文本块拆分方式:
内容流中de、连字符、cember的文本块拆分逻辑也会影响读取结果:如果三者在内容流中是连续的语义文本块(仅排版上断行),结合Hyphen Span标记,JAWS会自动合并;若拆分为独立的文本块,JAWS可能无法识别其为同一单词的断行部分。
内容的提问来源于stack exchange,提问作者tejas Reddy p
相关产品推荐
相关产品推荐

