使用R语言rvest包爬取复杂大学课程网站的技术求助
网页爬取求助:无法定位目标li元素
我正在开展一项研究项目,需要从我校网站提取各学院所有项目的课程信息。我有一定网页爬取经验,但我校网站的编码逻辑和我之前练习的网站不同。
我的目标分三步:
- 提取所有项目名称及其对应的课程大纲超链接
- 后续用类似脚本提取各项目课程大纲内的课程名称与对应课程代码
- 最终通过课程代码生成课程详情页URL并爬取相关数据
我观察到所需的名称+超链接信息存储在li元素中,尝试提取这些li元素来获取内部的a标签,但多次尝试均失败。相同脚本在其他网站可正常运行,问题应该出在无法准确定位目标元素。
以下是我使用的脚本,希望能得到帮助,确定html_elements()函数应使用的正确输入(当前的li.css-105mfs8无效):
#1 Setup Packages library(pacman) p_load('rvest', 'rlang') #2 Load Website Course Data URL = 'https://ocasys.rug.nl/current/catalog' document = read_html(URL) html_programmes <- document %>% html_elements('li.css-105mfs8') a_element <- html_programmes %>% html_element("a") programme_urls <- html_products %>% html_element("a") %>% html_attr("href") programmes <- data.frame( programme_urls, #corresponding name )
内容的提问来源于stack exchange,提问作者Mink
相关产品推荐
相关产品推荐

