You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Selenium提取谷歌搜索结果中的纯净URL(无需正则)

提取谷歌搜索结果cite标签中的纯净文本/URL

解决HTML标签干扰的方法

你可以通过以下几种无需正则的方式直接获取cite标签内的纯文本内容,自动剔除嵌套的HTML标签:

  • 使用WebElement的text属性:这是最常用的方式,返回元素的可见文本内容,自动合并子元素文本并去除HTML标签:

    pure_text = cite_element.text
    
  • 使用get_attribute('textContent'):获取元素包含的所有文本内容(包括隐藏文本),同样会忽略HTML标签结构:

    pure_text = cite_element.get_attribute('textContent')
    
  • 使用get_attribute('innerText'):效果和text属性类似,返回元素的可见文本:

    pure_text = cite_element.get_attribute('innerText')
    

完整代码示例

from selenium import webdriver
from selenium.webdriver.common.by import By

driver = webdriver.Chrome()
driver.get("https://www.google.com/search?q=your_search_query")

# 获取前10个搜索结果的cite标签
cite_elements = driver.find_elements(By.TAG_NAME, 'cite')[:10]

for cite in cite_elements:
    # 任选一种方法提取纯文本
    clean_url_text = cite.text
    print(clean_url_text)

driver.quit()

额外建议:获取实际跳转URL

如果你的目标是获取可直接访问的完整URL(而非cite标签显示的简化文本),建议直接定位搜索结果的<a>标签并提取href属性,这比从cite标签提取更准确:

result_links = driver.find_elements(By.CSS_SELECTOR, 'div.g a')[:10]
for link in result_links:
    actual_url = link.get_attribute('href')
    print(actual_url)

内容的提问来源于stack exchange,提问作者xlmaster

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 10:25:17