You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在R中提取HTML节点内文本?网页日期提取返回N/A求助

R提取网页日期返回N/A的修复方案

问题原因与解决步骤

  • 网页结构已更新,原CSS选择器#graph-out-last-updated对应的节点已不存在,导致提取不到内容。
  • 重新定位日期节点:打开网页开发者工具(F12),可发现日期文本现在位于div.graph-out__footer下的span标签内,或通过包含"Last updated"的文本特征定位。
  • 修改后的可运行脚本:
library(rvest)
library(magrittr)

webpage = read_html('https://www.longpaddock.qld.gov.au/aussiegrass')
# 方案1:通过CSS选择器定位父容器下的span
results = webpage %>% html_nodes(".graph-out__footer span")
# 方案2:通过XPath匹配包含指定文本的元素(更稳定,避免节点类名变更)
# results = webpage %>% html_nodes(xpath = "//*[contains(text(), 'Last updated')]")
webpage_date_chr = html_text(results)
webpage_date_chr
  • 注意:如果后续网页再次改版,重复上述开发者工具检查步骤,更新对应的选择器即可。

内容的提问来源于stack exchange,提问作者silas

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.18 00:22:13