如何用rvest包提取指定span标签中的时区值
使用rvest提取指定span标签的内容
要提取目标span中的"(GMT -4:00)",可以利用元素的唯一id属性直接定位,步骤如下:
- 加载rvest包并解析HTML文档
- 通过CSS选择器或XPath定位目标span元素
- 提取元素内的文本内容
代码实现
library(rvest) doc <- '<div id="economicCurrentTime" class="ecoCurrentTime "> <span class="grayClockIcon"> </span>Current Time: <span id="currentTime" class="bold blackFont" data-datetime="2023/09/01 19:27:02">19:27</span> <span id="timeZoneGmtOffsetFormatted">(GMT -4:00)</span> <span class="dropDownArrowGray"></span> </div>' # 解析HTML文档 parsed_doc <- read_html(doc) # 方法1:使用CSS选择器(推荐,id唯一定位更简洁) time_zone <- parsed_doc %>% html_element("#timeZoneGmtOffsetFormatted") %>% html_text(trim = TRUE) # 方法2:使用XPath定位 time_zone_xpath <- parsed_doc %>% html_element(xpath = "//span[@id='timeZoneGmtOffsetFormatted']") %>% html_text(trim = TRUE) # 输出结果 print(time_zone) # [1] "(GMT -4:00)"
说明
html_element():返回匹配到的第一个元素(由于id属性唯一,只会定位到目标span)html_text(trim = TRUE):提取元素文本并自动去除首尾多余的空白字符- CSS选择器中的
#符号用于指定匹配对应id的元素,是定位唯一元素最直观的方式
内容的提问来源于stack exchange,提问作者Camilo
相关产品推荐
相关产品推荐

