You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用R语言rvest包爬取网页的链接与文本内容

问题根源

你当前代码无法获取链接的核心原因是CSS选择器定位错误:演讲详情页的href属性挂载在.category-item-title h3内部的<a>子标签上,你直接对h3标签提取href属性自然无法得到有效值。

修正方案

调整link字段的CSS选择器到对应的a标签即可,修正后完整代码如下:

library(purrr)
library(rvest)
library(stringr)

url_president <- "https://www.casarosada.gob.ar/informacion/discursos?page=%d"
# 域名前缀,后续拼接相对路径用
base_url <- "https://www.casarosada.gob.ar"

map_df(1:2, function(i) {
  pg <- read_html(sprintf(url_president, i))
  data.frame(
    title = html_text(html_nodes(pg, ".category-item-title h3")) %>%
      str_trim(),
    date = html_text(html_nodes(pg, "time")),
    # 调整选择器定位到h3下的a标签,提取href后拼接域名得到完整链接
    link = html_elements(pg, css = ".category-item-title h3 a") %>% 
      html_attr('href') %>% 
      paste0(base_url, .),
    stringsAsFactors = FALSE
  )
}) -> argentina_speeches_pres

补充说明

  • 原页面返回的链接是相对路径,拼接域名前缀后才是可以直接访问的完整详情页地址,省去后续爬正文时再处理路径的步骤
  • 如果你只需要保留相对路径,去掉paste0(base_url, .)这一步即可

内容的提问来源于stack exchange,提问作者w5698

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 01:54:04