You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用rvest爬取kormany.hu站点时未提取到任何内容问题求助

问题原因及修复方案

1. 核心错误:URL格式不完整

你定义的url变量缺少https://协议头,read_html()无法识别无协议的地址为合法网络资源,导致页面内容根本没有被成功拉取,后续所有节点提取操作自然返回空值。
另外注意你描述中要爬取的站点域名是2010-2014.kormany.hu,但代码里写的是2015-2019.kormany.hu,如果是爬取目标填写错误,替换对应域名段即可。

2. 优化建议:简化节点选择逻辑

多层嵌套html_nodes()容易出现匹配范围偏差,你可以直接用精准的CSS选择器定位目标链接,代码可读性和匹配准确率都会更高。

可正常运行的代码示例

library(rvest)
library(dplyr)

# 补全URL的协议头,若需要爬取2010-2014的站点替换域名中的年份段即可
url <- 'https://2015-2019.kormany.hu/hu/hirek'
# 直接用CSS选择器定位文章列表下的a标签
links <- read_html(url) %>% 
  html_elements(css = ".article h2 a") %>% 
  html_attr("href")

links

内容的提问来源于stack exchange,提问作者zutt

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 17:27:02