You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python如何不借助Selenium实现普通浏览器的控制操作?

不依赖Selenium的浏览器控制方案实现指南

该需求完全可实现,主流方案均基于浏览器原生能力开发,无需依赖Selenium相关组件,具体实现方式如下:

方案1:基于浏览器原生CDP(Chrome DevTools Protocol)开发

这是目前功能最完整、稳定性最高的无Selenium控制方案,所有Chromium内核浏览器(Chrome、Edge、Brave等)、Firefox 86及以上版本均原生支持该协议。
操作步骤:

  • 给目标浏览器启动命令添加远程调试参数,例如Chrome启动时添加 --remote-debugging-port=9222,启动后浏览器会在本地9222端口暴露调试服务
  • 直接通过HTTP、WebSocket请求和调试端口交互,即可实现导航页面、执行网页JS、模拟点击输入、获取页面元素、拦截请求等所有Selenium支持的操作
  • 不同编程语言均有封装好的CDP客户端可以直接调用:Python可以用 pyppeteer,Go可以用 chromedp,Node.js可以用 puppeteer

方案2:调用浏览器原生自动化接口

部分浏览器内置了原生自动化驱动,无需Selenium的封装层即可直接调用:

  • 微软Edge内置原生WebDriver2接口,启动时添加对应参数即可直接调用
  • Safari开启开发菜单中的「允许远程自动化」选项后,可直接调用系统内置的Safari Driver实现控制,不需要额外引入Selenium依赖

方案3:调用系统级UI自动化接口

如果仅需要实现启动浏览器、打开指定页面、模拟键鼠输入等简单操作,可以直接用系统原生UI自动化能力实现:

  • Windows平台可以调用 UIAutomation 接口,Python环境下可以用 pywinauto、pyautogui 库实现
  • macOS平台可以通过 AppleScript 或者 AXUIElement 相关接口实现
  • Linux平台可以用 xdotool 命令实现窗口控制、模拟键鼠操作

注意事项

如果需要控制浏览器访问复杂网页、执行页面JS、处理跨域逻辑等操作,优先选择CDP相关方案,不会受窗口位置、分辨率等环境因素影响,稳定性远高于系统UI自动化方案。

内容的提问来源于stack exchange,提问作者Newby

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 06:48:03