R语言:使用rvest与RSelenium提取xml_nodeset文本内容求助
解决R中rvest提取HTML文本内容的问题
你已经成功定位到目标节点,只需要在rvest的管道操作中添加文本提取函数即可获取27/11/2020这个内容,有两种常用方式:
方法1:使用rvest的html_text()或html_text2()
修改你现有代码中提取数据的部分,在html_nodes()之后追加文本提取函数:
primeiro_aporte <- read_html(html) %>% html_nodes(xpath='//*[@id="output__container--primeiroAporte"]/div/span') %>% html_text() # 提取节点内的原始文本 primeiro_aporte
如果需要自动清理文本中的换行、多余空格,推荐使用html_text2()(rvest 1.0.0及以上版本支持):
primeiro_aporte <- read_html(html) %>% html_nodes(xpath='//*[@id="output__container--primeiroAporte"]/div/span') %>% html_text2() # 智能格式化文本输出 primeiro_aporte
方法2:直接用RSelenium提取文本
无需转换为HTML再用rvest处理,可直接通过RSelenium的元素对象获取文本:
# 定位目标元素 primeiro_aporte_element <- remDr$findElement("xpath", '//*[@id="output__container--primeiroAporte"]/div/span') # 提取文本内容 primeiro_aporte <- primeiro_aporte_element$getElementText()[[1]] primeiro_aporte
内容的提问来源于stack exchange,提问作者Robert
相关产品推荐
相关产品推荐

