You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用rvest筛选指定class下的特定href 排除tel开头的电话号码链接

R语言爬取零售门店路径过滤电话号码超链接解决方案

方法1:对已爬取的链接向量做后置过滤

你已经拿到了所有链接,直接过滤出以/store/开头的元素即可,用到stringr包的str_subset函数,修改后代码如下:

library(rvest)
library(tidyverse)
library(xml2)

store.paths <- read_html("https://www.walmart.com/store/directory/al/alabaster") %>%
    html_nodes(xpath = '//*[@class="store-directory-container"]') %>% 
    html_nodes("a") %>% 
    html_attr('href') %>%
    # 新增过滤逻辑:仅保留/store/开头的门店路径
    str_subset("^/store/")

运行后输出就是你需要的结果:

[1] "/store/4756"  "/store/423"

方法2:在节点匹配阶段直接过滤,效率更高

可以直接在xpath规则里增加href属性的前缀匹配规则,只爬取符合要求的链接,不需要爬取电话链接后再过滤:

store.paths <- read_html("https://www.walmart.com/store/directory/al/alabaster") %>%
    html_nodes(xpath = '//*[@class="store-directory-container"]//a[starts-with(@href,"/store/")]') %>% 
    html_attr('href')

你之前替换storeBanner返回空的原因:storeBanner类对应的节点不包含你需要的门店超链接元素,原代码使用的store-directory-container容器是正确的,不需要修改。

内容的提问来源于stack exchange,提问作者JR96

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 19:27:05