R网页抓取特定值:目标值6.911,930无法通过表格提取
R网页抓取:提取指定XPath位置的目标值
解决方案步骤:
- 确保已安装并加载
rvest包(若未安装,先执行install.packages("rvest")) - 直接通过你定位到的XPath路径精准获取目标元素的文本内容
完整代码:
# 安装/加载依赖包 if (!require(rvest)) { install.packages("rvest") library(rvest) } # 目标网页链接 link <- "https://www2.bmf.com.br/pages/portal/bmfbovespa/boletim1/SistemaPregao1.asp?pagetype=pop&caminho=Resumo%20Estat%EDstico%20-%20Sistema%20Preg%E3o&Data=04/06/2024&Mercadoria=DAP" # 读取网页内容 Pag_bmf <- read_html(link) # 通过XPath定位目标单元格并提取文本 target_value <- html_node(Pag_bmf, xpath = "/html/body/div/div[2]/form[1]/table[5]/tbody/tr[3]/td") %>% html_text(trim = TRUE) # 输出目标值 print(target_value)
代码说明:
- 使用
html_node()配合xpath参数直接定位目标元素,避免了通过表格索引定位可能出现的结构变动误差 html_text(trim = TRUE)会自动清除文本前后的空白字符,确保得到干净的目标值6.911,930
内容的提问来源于stack exchange,提问作者Osvaldo Assunção
相关产品推荐
相关产品推荐

