You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python与BeautifulSoup解析Google Scholar搜索结果

从Google Scholar搜索结果提取文献标题和URL

我来帮你搞定这个解析问题!你已经成功获取到了页面的HTML内容,接下来只需要用BeautifulSoup定位到对应的元素,就能提取出你要的标题和URL啦。

关键思路

Google Scholar的搜索结果里,每篇文献的标题都包裹在<h3 class="gs_rt">标签中,而标题对应的跳转链接就藏在这个h3标签下的<a>标签里。我们只需要遍历所有这类元素,提取对应的内容即可。

完整解析代码

把你原来代码里的print page替换成下面这段代码:

# 初始化存储结果的列表
results = []

# 定位所有包含文献标题的h3元素
for result_item in page.find_all('h3', class_='gs_rt'):
    # 提取标题文本,strip=True去除多余空格和换行
    article_title = result_item.get_text(strip=True)
    # 找到标题对应的a标签(即跳转链接)
    link_element = result_item.find('a')
    
    # 确保存在有效链接时再添加到结果中
    if link_element:
        article_url = link_element['href']
        results.append({'title': article_title, 'url': article_url})

# 打印提取到的结果
for item in results:
    print(item)

小提示

  • Google Scholar的页面结构偶尔会更新,如果之后发现提取不到内容,记得用浏览器开发者工具(按F12)查看最新的元素class或标签结构,调整选择器即可。
  • 有些特殊条目(比如被引用的文献、无公开链接的内容)可能没有<a>标签,所以加了if link_element的判断,避免程序报错。

内容的提问来源于stack exchange,提问作者maurobio

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.29 07:12:15