R语言tabulizer包extract_tables函数SSL连接与Java相关报错求解
问题1:sbb.gov.tr站点PDF提取报错
你修改URL为http后仍然提示https异常,是因为该站点配置了HTTP到HTTPS的强制跳转,extract_tables内部调用下载工具时会自动跟随跳转,所以实际请求的仍然是HTTPS地址,触发SSL连接错误。
解决方法:
优先选择手动下载PDF到本地后,将本地文件路径传入extract_tables处理,避免在线请求的SSL兼容问题,示例代码:
# 先下载到本地 download.file( "http://www.sbb.gov.tr/wp-content/uploads/2020/04/KonutPolitikalariOzelIhtisasKomisyonuRaporu.pdf", destfile = "local_report.pdf", method = "libcurl", extra = "-k" ) # 读取本地PDF提取表格 out <- extract_tables("local_report.pdf")
问题2:维基百科链接提取报错
Error: Header doesn't contain versioninfo错误是因为你传入的http://en.wikipedia.org/wiki/HTTPS是HTML网页地址,并非PDF文件,tabulizer仅支持解析PDF格式文件,无法识别网页内容,不属于Java版本或包安装问题。你可以替换为在线PDF链接或者本地PDF文件测试即可。
补充验证步骤
你可以先找任意本地PDF文件运行提取代码,确认包本身运行正常:
# 替换为你本地的PDF路径 out_test <- extract_tables("~/test.pdf")
如果本地提取正常,说明你当前的Java版本、tabulizer安装配置都没有问题,所有报错都来自在线资源的请求或文件类型不匹配问题。
内容的提问来源于stack exchange,提问作者mzkrc
相关产品推荐
相关产品推荐

