如何在R中直接从链接导入CSV?解决原方法返回HTML问题
直接导入football-data.co.uk CSV数据的解决方案
问题根源是该网站现在会校验请求的User-Agent字段,默认的R请求头会被判定为非浏览器请求,从而返回HTML页面而非目标CSV数据。以下是无需本地下载即可直接导入的方法:
方法1:使用httr + readr
通过设置浏览器模拟的请求头获取数据,再用readr读取:
library(httr) library(readr) # 发送带合法请求头的GET请求 resp <- GET( url = "http://www.football-data.co.uk/mmz4281/2223/B1.csv", add_headers( "User-Agent" = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36" ) ) # 从响应文本中读取CSV数据 data <- read_csv(content(resp, "text"))
方法2:使用httr + data.table
如果习惯用data.table的fread,同样可以基于响应文本读取:
library(httr) library(data.table) resp <- GET( url = "http://www.football-data.co.uk/mmz4281/2223/B1.csv", add_headers( "User-Agent" = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36" ) ) data <- fread(content(resp, "text"))
注意事项
- 你可以替换
User-Agent为任意主流浏览器的标识,只要能模拟正常的浏览器请求即可; - 若后续再次出现类似问题,可检查网站是否更新了反爬策略,调整请求头参数即可。
内容的提问来源于stack exchange,提问作者jalapic
相关产品推荐
相关产品推荐

