如何使用R语言rvest包爬取网页的链接与文本内容
问题根源
你当前代码无法获取链接的核心原因是CSS选择器定位错误:演讲详情页的href属性挂载在.category-item-title h3内部的<a>子标签上,你直接对h3标签提取href属性自然无法得到有效值。
修正方案
调整link字段的CSS选择器到对应的a标签即可,修正后完整代码如下:
library(purrr) library(rvest) library(stringr) url_president <- "https://www.casarosada.gob.ar/informacion/discursos?page=%d" # 域名前缀,后续拼接相对路径用 base_url <- "https://www.casarosada.gob.ar" map_df(1:2, function(i) { pg <- read_html(sprintf(url_president, i)) data.frame( title = html_text(html_nodes(pg, ".category-item-title h3")) %>% str_trim(), date = html_text(html_nodes(pg, "time")), # 调整选择器定位到h3下的a标签,提取href后拼接域名得到完整链接 link = html_elements(pg, css = ".category-item-title h3 a") %>% html_attr('href') %>% paste0(base_url, .), stringsAsFactors = FALSE ) }) -> argentina_speeches_pres
补充说明
- 原页面返回的链接是相对路径,拼接域名前缀后才是可以直接访问的完整详情页地址,省去后续爬正文时再处理路径的步骤
- 如果你只需要保留相对路径,去掉
paste0(base_url, .)这一步即可
内容的提问来源于stack exchange,提问作者w5698
相关产品推荐
相关产品推荐

