You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Python Selenium筛选并点击包含指定关键词的搜索结果链接

实现方案

Selenium完全可以实现该需求,你现有代码的核心问题是仅尝试匹配文本完全为指定关键词的单个元素,未做批量链接匹配和属性提取,以下是可直接运行的改进实现:

原有代码问题说明

  • 使用By.LINK_TEXT仅能匹配文本完全等于Watches的单个链接元素,无法匹配所有包含指定关键词的链接
  • 未提取链接的href属性实现存储逻辑
  • Windows路径中的反斜杠需要转义或使用原始字符串,避免触发转义字符报错

改进代码

from selenium import webdriver
from selenium.webdriver.common.keys import Keys
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import time

# 高版本Selenium(4.6+)无需手动指定chromedriver路径,会自动匹配
# 旧版本用户可保留以下两行配置,注意路径前加r前缀避免转义问题
# PATH = r"C:\Program Files (x86)\chromedriver.exe"
# driver = webdriver.Chrome(PATH)
driver = webdriver.Chrome()

# 谷歌搜索关键词
search_keyword = "watch"
# 链接需要匹配的关键词
match_keyword = "Watches"
# 存储匹配到的有效链接
matched_links = []

driver.get("https://www.google.com/")

try:
    # 等待搜索框加载,输入关键词触发搜索
    search = WebDriverWait(driver, 10).until(
        EC.presence_of_element_located((By.NAME,"q"))
    )
    search.clear()
    search.send_keys(search_keyword)
    search.send_keys(Keys.ENTER)
    
    # 等待搜索结果页链接加载完成
    WebDriverWait(driver, 10).until(
        EC.presence_of_element_located((By.TAG_NAME, "a"))
    )
    time.sleep(1) # 额外等待避免动态内容未加载完全
    
    # 批量获取页面所有a标签元素
    all_links = driver.find_elements(By.TAG_NAME, "a")
    
    for link in all_links:
        try:
            link_text = link.text.strip()
            link_href = link.get_attribute("href")
            # 匹配逻辑:文本包含指定关键词、链接不为空
            if match_keyword in link_text and link_href:
                # 自动去重
                if link_href not in matched_links:
                    matched_links.append(link_href)
        except:
            # 跳过无效的异常链接元素
            continue
    
    # 输出结果,可自行修改为写入本地txt、csv文件持久化存储
    print(f"共找到{len(matched_links)}个符合条件的链接:")
    for url in matched_links:
        print(url)
        
except Exception as e:
    print(f"运行出错:{str(e)}")
finally:
    time.sleep(2)
    driver.quit()

可选调整项

  • 若不需要大小写敏感匹配,可将匹配逻辑改为match_keyword.lower() in link_text.lower()
  • 若需要爬取多页搜索结果,可添加模拟点击下一页的逻辑,获取后续页面链接继续匹配
  • 可自行添加代码将matched_links列表写入本地文件实现长期保存

内容的提问来源于stack exchange,提问作者Sarthak Hingankar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.07 00:57:02