You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Python实现带Google登录认证的页面内容抓取?

如何用Python 3.x获取需谷歌登录的页面内容

当然可以实现,主要有两种实用方案,按需选择:

方案一:requests + 登录后Cookie

这种方法适合不需要频繁登录的场景,步骤简单:

  • 先在浏览器里正常登录谷歌账号、打开目标页面,按F12打开开发者工具,切换到Network标签,刷新页面后找到目标请求,复制请求头里的Cookie字段内容。
  • 用requests带着Cookie和模拟浏览器的User-Agent发请求:
    import requests
    
    target_url = "你的目标URL"
    headers = {
        "Cookie": "粘贴从浏览器复制的Cookie字符串",
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36"
    }
    
    resp = requests.get(target_url, headers=headers)
    if resp.status_code == 200:
        print(resp.text)  # 输出页面内容
    else:
        print(f"请求失败,状态码:{resp.status_code}")
    
  • 注意:Cookie有有效期,过期后得重新复制;User-Agent尽量和你用的浏览器一致,避免被网站拦截。

方案二:自动化浏览器工具(以selenium为例)

适合需要重复登录或Cookie频繁失效的场景,模拟真实浏览器操作:

  • 先安装依赖:
    pip install selenium
    
    还要下载对应浏览器的驱动(比如Chrome的ChromeDriver,版本要和浏览器匹配)。
  • 编写代码模拟登录流程:
    from selenium import webdriver
    from selenium.webdriver.common.by import By
    import time
    
    # 初始化浏览器驱动
    driver = webdriver.Chrome()
    driver.get("你的目标URL")
    
    # 定位并点击"Continue with google"按钮(XPath或Selector要根据页面实际元素调整)
    login_btn = driver.find_element(By.XPATH, "//button[contains(text(), 'Continue with google')]")
    login_btn.click()
    
    # 这里留时间手动完成谷歌登录(不建议自动填账号密码,容易触发谷歌安全验证)
    time.sleep(10)
    
    # 登录成功后获取页面源码
    page_content = driver.page_source
    print(page_content)
    
    driver.quit()
    
  • 注意:部分网站会检测自动化工具,可通过配置浏览器选项(如禁用自动化标识)规避;手动登录更稳定,避免被验证码拦截。

内容的提问来源于stack exchange,提问作者Yuri Levinsky

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.08 02:56:10