You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用R提取HTML嵌入PDF文本遇403及RSelenium无效问题求助

使用R提取嵌入PDF文本或自动下载PDF时的403禁止访问问题

我正在用R尝试获取HTML中嵌入PDF的文本(最好保留部分格式),目标PDF的URL为:https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf

尝试直接使用pdf_text函数报错

执行以下代码时出现403禁止访问错误:

pdf_text <- pdf_text("https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf")

报错信息:

Error in open.connection(con, "rb") : 
  cannot open the connection to 'https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf'
In addition: Warning message:
In open.connection(con, "rb") :
  cannot open URL 'https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf': HTTP status was '403 Forbidden'

尝试RSelenium导航提取内容失败

用RSelenium访问该URL后,获取到的页面源码仅包含空的PDF嵌入标签,无法提取内容:

remDr$navigate("https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf")
pageHTML <- remDr$getPageSource()[[1]]
pageHTML

输出结果:

[1] "<html><head></head><body style=\"height: 100%; width: 100%; overflow: hidden; margin:0px; background-color: rgb(82, 86, 89);\"><embed name=\"843DE9299AC47C3596F8B8E1296AD1FC\" style=\"position:absolute; left: 0; top: 0;\" width=\"100%\" height=\"100%\" src=\"about:blank\" type=\"application/pdf\" internalid=\"843DE9299AC47C3596F8B8E1296AD1FC\"></body></html>"

需求补充

如果无法直接提取文本,我可以接受先自动下载PDF再用pdf_text处理,但目前无法通过RSelenium实现下载,求可行的解决方法。

内容的提问来源于stack exchange,提问作者user17661126

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.17 03:22:45