使用R提取HTML嵌入PDF文本遇403及RSelenium无效问题求助
使用R提取嵌入PDF文本或自动下载PDF时的403禁止访问问题
我正在用R尝试获取HTML中嵌入PDF的文本(最好保留部分格式),目标PDF的URL为:https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf
尝试直接使用pdf_text函数报错
执行以下代码时出现403禁止访问错误:
pdf_text <- pdf_text("https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf")
报错信息:
Error in open.connection(con, "rb") : cannot open the connection to 'https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf' In addition: Warning message: In open.connection(con, "rb") : cannot open URL 'https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf': HTTP status was '403 Forbidden'
尝试RSelenium导航提取内容失败
用RSelenium访问该URL后,获取到的页面源码仅包含空的PDF嵌入标签,无法提取内容:
remDr$navigate("https://www.nycourts.gov/courts/ad2/Handdowns/2024/10-October/10-02-2024_FINAL_HANDDOWN_LIST.pdf") pageHTML <- remDr$getPageSource()[[1]] pageHTML
输出结果:
[1] "<html><head></head><body style=\"height: 100%; width: 100%; overflow: hidden; margin:0px; background-color: rgb(82, 86, 89);\"><embed name=\"843DE9299AC47C3596F8B8E1296AD1FC\" style=\"position:absolute; left: 0; top: 0;\" width=\"100%\" height=\"100%\" src=\"about:blank\" type=\"application/pdf\" internalid=\"843DE9299AC47C3596F8B8E1296AD1FC\"></body></html>"
需求补充
如果无法直接提取文本,我可以接受先自动下载PDF再用pdf_text处理,但目前无法通过RSelenium实现下载,求可行的解决方法。
内容的提问来源于stack exchange,提问作者user17661126
相关产品推荐
相关产品推荐

