如何用R从含“点击下载”按钮的网站下载CSV文件(无需精确URL)
好问题!当遇到这种带“点击下载”按钮的动态下载场景时,直接用download.file()确实不好使——它需要明确的文件直链,而这类按钮通常会把真实链接藏在页面元素或JS逻辑里。下面给你几个可行的R方案,亲测适用于这个WHO的网站:
方法1:直接抓取真实的CSV下载URL
很多看似“点击触发”的下载按钮,背后其实是指向真实文件的静态链接,只是被包装成了按钮样式。你可以手动抓取这个链接:
- 打开目标网站,按下F12打开浏览器开发者工具
- 切换到「网络」标签,勾选「保留日志」选项
- 点击页面上的“下载CSV”按钮,这时会在网络请求列表里看到一个新的CSV文件请求
- 复制这个请求的完整URL,直接用
download.file()调用即可
比如我刚才测试时,这个页面的CSV真实直链是:
download.file("http://apps.who.int/gho/athena/api/GHO/MHSUICIDEASDRREG.csv?filter=REGION:*;YEAR:*&x-sideaxis=REGION&x-topaxis=YEAR&profile=crosstable", destfile = "../data.csv", method = "curl")
(如果后续链接失效,按照上面的步骤重新抓取即可)
方法2:用rvest包自动提取下载链接
如果不想手动找URL,可以用rvest解析页面,自动获取下载按钮对应的链接,更灵活:
- 先安装并加载rvest包:
install.packages("rvest") library(rvest)
- 抓取页面并提取下载链接:
# 获取页面内容 page <- read_html("http://apps.who.int/gho/data/view.main.MHSUICIDEASDRREGv?lang=en") # 定位带CSV下载标识的链接,提取href属性 csv_link <- page %>% html_element(css = "a[title='Download CSV']") %>% html_attr("href") # 补全相对路径为完整URL csv_full_link <- paste0("http://apps.who.int", csv_link) # 下载文件 download.file(csv_full_link, destfile = "../data.csv", method = "curl")
只要页面的下载按钮元素结构不变,这个方法就能自动适配。
方法3:用RSelenium模拟浏览器点击(应对复杂动态场景)
如果页面是纯JS渲染的动态页面(比如链接需要触发JS生成),上面的方法可能失效,这时候可以用RSelenium模拟真实浏览器的点击操作:
- 安装并加载RSelenium包(需要提前安装对应浏览器的驱动,比如ChromeDriver):
install.packages("RSelenium") library(RSelenium)
- 启动浏览器并模拟下载:
# 启动Chrome浏览器驱动 driver <- rsDriver(browser = "chrome") remDr <- driver[["client"]] # 打开目标页面 remDr$navigate("http://apps.who.int/gho/data/view.main.MHSUICIDEASDRREGv?lang=en") # 找到下载按钮并点击 download_button <- remDr$findElement(using = "css selector", value = "a[title='Download CSV']") download_button$clickElement() # 等待下载完成后,将文件从浏览器默认下载文件夹移到目标路径(请替换为你的实际下载路径) file.copy("~/Downloads/MHSUICIDEASDRREG.csv", "../data.csv", overwrite = TRUE) # 关闭浏览器和驱动 remDr$close() driver$server$stop()
这个方法通用性最强,但需要配置浏览器驱动,步骤稍繁琐。
内容的提问来源于stack exchange,提问作者Sukriti Singh
相关产品推荐
相关产品推荐

