You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从谷歌搜索结果中提取深层HTML标签内的摘要?

提取谷歌搜索结果摘要的方法

首先,你得先搞清楚谷歌搜索结果里摘要对应的HTML结构——毕竟谷歌偶尔会调整页面元素的类名或层级。最简单的方式是用浏览器开发者工具定位摘要元素:

  • 打开谷歌搜索结果页,找到目标摘要文本
  • 右键点击摘要,选择「检查」(Chrome/Firefox都支持)
  • 在开发者工具的Elements面板里,查看摘要所在的标签及其父级标签,找到一个稳定的选择器(比如类名或组合选择器)

通常来说,谷歌搜索结果的摘要会放在这些结构里:

  • 带有 VwiC3b 类的 div 标签
  • 或者 IsZvec 类的 span 标签(如果是短摘要或高亮片段)
  • 这些元素一般都嵌套在搜索结果的主容器(带有 g 类的 div)里面

用Python + BeautifulSoup实现提取

假设你已经在用BeautifulSoup解析页面,只需要在现有提取标题和URL的代码基础上,添加摘要提取的逻辑即可:

from bs4 import BeautifulSoup
import requests
import time

# 模拟浏览器请求头,避免被谷歌拦截
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36'
}

# 示例搜索URL
search_url = "https://www.google.com/search?q=python+web+scraping"
response = requests.get(search_url, headers=headers)
soup = BeautifulSoup(response.text, 'html.parser')

# 遍历每个搜索结果块
for result in soup.find_all('div', class_='g'):
    # 提取标题
    title_elem = result.find('h3')
    title = title_elem.get_text(strip=True) if title_elem else "无标题"
    
    # 提取URL
    url_elem = result.find('a')
    url = url_elem['href'] if url_elem else "无URL"
    
    # 提取摘要(优先找VwiC3b,找不到再试IsZvec)
    summary_elem = result.find('div', class_='VwiC3b')
    if not summary_elem:
        summary_elem = result.find('span', class_='IsZvec')
    
    summary = summary_elem.get_text(strip=True) if summary_elem else "无摘要"
    
    print(f"标题: {title}\n链接: {url}\n摘要: {summary}\n---")
    # 添加请求间隔,避免被反爬拦截
    time.sleep(2)

实用注意事项

  1. 类名可能变化:谷歌会不定期调整页面元素的类名,如果某天代码突然失效,记得重新用开发者工具检查最新的标签结构。
  2. 反爬机制:谷歌对频繁的自动化请求会有拦截,建议添加请求间隔,使用真实的User-Agent头,必要时可以考虑使用代理IP。
  3. 复杂摘要处理:有些摘要可能包含换行、高亮标记,get_text(strip=True) 可以自动去除多余空格和HTML标签,提取干净的纯文本内容。

内容的提问来源于stack exchange,提问作者Minions

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 09:17:50