You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

无法将在线Excel数据下载至R的问题求助

解决从美国教育部网站直接下载Excel数据超时的问题

这个问题大概率是网站拦截了R默认的请求头(User-Agent),以下是两种可行的解决方法:

方法一:使用httr + readxl 自定义请求头下载

通过模拟浏览器的请求头绕过反爬拦截,先将文件下载到临时文件再读取:

library(httr)
library(readxl)

# 目标数据URL
url <- "https://studentaid.gov/sites/default/files/fsawg/datacenter/library/Portfolio-by-Debt-Size.xls"

# 设置模拟浏览器的请求头
request_headers <- add_headers(
  "User-Agent" = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36"
)

# 创建临时文件存储下载的Excel
temp_file <- tempfile(fileext = ".xls")

# 发送请求并下载文件
response <- GET(url, request_headers, write_disk(temp_file, overwrite = TRUE))

# 验证下载是否成功并读取数据
if (http_status(response)$category == "Success") {
  # 读取第2个工作表(可根据实际需求调整sheet参数)
  df_portfolio <- read_excel(temp_file, sheet = 2)
  # 查看数据结构
  str(df_portfolio)
} else {
  stop("下载失败,响应状态码:", response$status_code)
}

方法二:使用download.file 配合curl 设置请求头

如果你的系统已安装curl,可直接用download.file指定请求头下载:

library(readxl)

url <- "https://studentaid.gov/sites/default/files/fsawg/datacenter/library/Portfolio-by-Debt-Size.xls"
temp_file <- tempfile(fileext = ".xls")

# 用curl作为下载方法,添加浏览器请求头
download.file(
  url = url,
  destfile = temp_file,
  mode = "wb",
  method = "curl",
  extra = "-H \"User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36\""
)

# 读取数据
df_portfolio <- read_excel(temp_file, sheet = 2)
str(df_portfolio)

注意事项

  • 如果你的系统没有curl,可尝试将method参数改为"libcurl"(若R已配置),或安装curl工具后再使用上述方法。
  • User-Agent可替换为任意主流浏览器的标识,只要避免使用R默认的请求头即可。

内容的提问来源于stack exchange,提问作者miles_bytes

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 20:42:23