为何从该PDF提取文本会出现N-1凯撒移位现象?
PDF文本提取出现凯撒移位乱码的原因排查
- 我首次发帖,想搞清楚这个问题的原因:
我正在测试pypdf库,准备用于大型文本分析项目,找了桌面的几份PDF测试。多数文件都能正常提取文本,但有一份之前复制粘贴就出问题的PDF,用以下代码提取:
from pypdf import PdfReader reader = PdfReader("HW-W6.pdf") page = reader.pages[0] print(page.extract_text())
输出内容如下:
HWWe16mkWrmoe5..Ptoonrdsgdl×mlVsqhw,gVrsgdenql,8,0,1.vgdqd,0hrVmnmrhmftiVqlVsqhwnechldmrhnmm×mVmc,1hrVmVqahsqVqxlVsqhwnechldmrhnmlm(×m-LqnudsgVs},}1≤},00}1.5.1Fds,adVml×mlVsqhw-TrdsgdrsdoradinvsnrgnvsgVsVudbsnqu∈irVshrdr,u8+heVmcnmixhe,,u8+-SghrvhiirgnvsgVsAnbb,(8Anbb,,(-V(PgnvsgVshe,u8+)sgdm,,u8+:a(Ptoonrd,,u8+-PgnvsgVs,u8+-5.2PgnvsgdUVmcdqlnmcdlVsqhwhmfi..-1(hrmnmrhmftiVqVrinmfVrsgdonhmsr{uT{Vqdchr,shmbs-5.3;hmcVidVrsrnitshnmenqsgdeniinvhmfoqnaidlr4V(,805010006.N80105a(,8022030061.N83235.4;hmcsgddptVshnmx8+)0unesgdidVrs,rptVqdrihmdsgVsadrssrsgdcVsVonhmsr1.0()3.1()6.2(Vmc7.2(-
- 一开始以为是完全乱码,可能是混淆处理,但聚焦字符串
Ptoonrd,对比预期文本“Suppose.”后,发现是N-1凯撒移位(每个字母向前偏移一位),但移位并不完美,其他复制粘贴场景也能体现这一点。 - 目前唯一线索是该文档可能由LaTeX编译而成,甚至在浏览器中打开也会丢失部分字符,想知道这一现象的原因。
内容的提问来源于stack exchange,提问作者Don D. Dizzle
相关产品推荐
相关产品推荐

