使用rvest筛选指定class下的特定href 排除tel开头的电话号码链接
R语言爬取零售门店路径过滤电话号码超链接解决方案
方法1:对已爬取的链接向量做后置过滤
你已经拿到了所有链接,直接过滤出以/store/开头的元素即可,用到stringr包的str_subset函数,修改后代码如下:
library(rvest) library(tidyverse) library(xml2) store.paths <- read_html("https://www.walmart.com/store/directory/al/alabaster") %>% html_nodes(xpath = '//*[@class="store-directory-container"]') %>% html_nodes("a") %>% html_attr('href') %>% # 新增过滤逻辑:仅保留/store/开头的门店路径 str_subset("^/store/")
运行后输出就是你需要的结果:
[1] "/store/4756" "/store/423"
方法2:在节点匹配阶段直接过滤,效率更高
可以直接在xpath规则里增加href属性的前缀匹配规则,只爬取符合要求的链接,不需要爬取电话链接后再过滤:
store.paths <- read_html("https://www.walmart.com/store/directory/al/alabaster") %>% html_nodes(xpath = '//*[@class="store-directory-container"]//a[starts-with(@href,"/store/")]') %>% html_attr('href')
你之前替换storeBanner返回空的原因:storeBanner类对应的节点不包含你需要的门店超链接元素,原代码使用的store-directory-container容器是正确的,不需要修改。
内容的提问来源于stack exchange,提问作者JR96
相关产品推荐
相关产品推荐

