You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用R语言rvest包爬取复杂大学课程网站的技术求助

网页爬取求助:无法定位目标li元素

我正在开展一项研究项目,需要从我校网站提取各学院所有项目的课程信息。我有一定网页爬取经验,但我校网站的编码逻辑和我之前练习的网站不同。

我的目标分三步:

  • 提取所有项目名称及其对应的课程大纲超链接
  • 后续用类似脚本提取各项目课程大纲内的课程名称与对应课程代码
  • 最终通过课程代码生成课程详情页URL并爬取相关数据

我观察到所需的名称+超链接信息存储在li元素中,尝试提取这些li元素来获取内部的a标签,但多次尝试均失败。相同脚本在其他网站可正常运行,问题应该出在无法准确定位目标元素。

以下是我使用的脚本,希望能得到帮助,确定html_elements()函数应使用的正确输入(当前的li.css-105mfs8无效):

#1 Setup Packages

library(pacman)
p_load('rvest', 'rlang')

#2 Load Website Course Data
URL = 'https://ocasys.rug.nl/current/catalog'
document = read_html(URL)

html_programmes <- document %>% html_elements('li.css-105mfs8')

a_element <- html_programmes %>% html_element("a") 

programme_urls <- html_products %>% 
  html_element("a") %>% 
  html_attr("href") 

programmes <- data.frame( 
  programme_urls, 
  #corresponding name
)

内容的提问来源于stack exchange,提问作者Mink

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 04:05:07