使用rvest爬取kormany.hu站点时未提取到任何内容问题求助
问题原因及修复方案
1. 核心错误:URL格式不完整
你定义的url变量缺少https://协议头,read_html()无法识别无协议的地址为合法网络资源,导致页面内容根本没有被成功拉取,后续所有节点提取操作自然返回空值。
另外注意你描述中要爬取的站点域名是2010-2014.kormany.hu,但代码里写的是2015-2019.kormany.hu,如果是爬取目标填写错误,替换对应域名段即可。
2. 优化建议:简化节点选择逻辑
多层嵌套html_nodes()容易出现匹配范围偏差,你可以直接用精准的CSS选择器定位目标链接,代码可读性和匹配准确率都会更高。
可正常运行的代码示例
library(rvest) library(dplyr) # 补全URL的协议头,若需要爬取2010-2014的站点替换域名中的年份段即可 url <- 'https://2015-2019.kormany.hu/hu/hirek' # 直接用CSS选择器定位文章列表下的a标签 links <- read_html(url) %>% html_elements(css = ".article h2 a") %>% html_attr("href") links
内容的提问来源于stack exchange,提问作者zutt
相关产品推荐
相关产品推荐

