You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言tabulizer包extract_tables函数SSL连接与Java相关报错求解

问题1:sbb.gov.tr站点PDF提取报错

你修改URL为http后仍然提示https异常,是因为该站点配置了HTTP到HTTPS的强制跳转,extract_tables内部调用下载工具时会自动跟随跳转,所以实际请求的仍然是HTTPS地址,触发SSL连接错误。
解决方法:
优先选择手动下载PDF到本地后,将本地文件路径传入extract_tables处理,避免在线请求的SSL兼容问题,示例代码:

# 先下载到本地
download.file(
  "http://www.sbb.gov.tr/wp-content/uploads/2020/04/KonutPolitikalariOzelIhtisasKomisyonuRaporu.pdf",
  destfile = "local_report.pdf",
  method = "libcurl",
  extra = "-k"
)
# 读取本地PDF提取表格
out <- extract_tables("local_report.pdf")

问题2:维基百科链接提取报错

Error: Header doesn't contain versioninfo错误是因为你传入的http://en.wikipedia.org/wiki/HTTPS是HTML网页地址,并非PDF文件,tabulizer仅支持解析PDF格式文件,无法识别网页内容,不属于Java版本或包安装问题。你可以替换为在线PDF链接或者本地PDF文件测试即可。

补充验证步骤

你可以先找任意本地PDF文件运行提取代码,确认包本身运行正常:

# 替换为你本地的PDF路径
out_test <- extract_tables("~/test.pdf")

如果本地提取正常,说明你当前的Java版本、tabulizer安装配置都没有问题,所有报错都来自在线资源的请求或文件类型不匹配问题。

内容的提问来源于stack exchange,提问作者mzkrc

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 02:27:05