无法将在线Excel数据下载至R的问题求助
解决从美国教育部网站直接下载Excel数据超时的问题
这个问题大概率是网站拦截了R默认的请求头(User-Agent),以下是两种可行的解决方法:
方法一:使用httr + readxl 自定义请求头下载
通过模拟浏览器的请求头绕过反爬拦截,先将文件下载到临时文件再读取:
library(httr) library(readxl) # 目标数据URL url <- "https://studentaid.gov/sites/default/files/fsawg/datacenter/library/Portfolio-by-Debt-Size.xls" # 设置模拟浏览器的请求头 request_headers <- add_headers( "User-Agent" = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36" ) # 创建临时文件存储下载的Excel temp_file <- tempfile(fileext = ".xls") # 发送请求并下载文件 response <- GET(url, request_headers, write_disk(temp_file, overwrite = TRUE)) # 验证下载是否成功并读取数据 if (http_status(response)$category == "Success") { # 读取第2个工作表(可根据实际需求调整sheet参数) df_portfolio <- read_excel(temp_file, sheet = 2) # 查看数据结构 str(df_portfolio) } else { stop("下载失败,响应状态码:", response$status_code) }
方法二:使用download.file 配合curl 设置请求头
如果你的系统已安装curl,可直接用download.file指定请求头下载:
library(readxl) url <- "https://studentaid.gov/sites/default/files/fsawg/datacenter/library/Portfolio-by-Debt-Size.xls" temp_file <- tempfile(fileext = ".xls") # 用curl作为下载方法,添加浏览器请求头 download.file( url = url, destfile = temp_file, mode = "wb", method = "curl", extra = "-H \"User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36\"" ) # 读取数据 df_portfolio <- read_excel(temp_file, sheet = 2) str(df_portfolio)
注意事项
- 如果你的系统没有curl,可尝试将
method参数改为"libcurl"(若R已配置),或安装curl工具后再使用上述方法。 - User-Agent可替换为任意主流浏览器的标识,只要避免使用R默认的请求头即可。
内容的提问来源于stack exchange,提问作者miles_bytes
相关产品推荐
相关产品推荐

