Pyppeteer爬虫遇问题:如何离线下载RHEL7.9最新Headless Chrome
解决Headless Chrome版本过旧及离线下载问题
一、确认Headless Chrome最新版本
Headless Chrome的版本与Chrome Stable正式版完全同步,你可以通过两种方式获取最新版本号:
- 打开已安装的Chrome浏览器,在地址栏输入
chrome://settings/help,查看当前最新稳定版号 - 在终端/命令行中,若已有Chrome,执行
google-chrome --version(Linux/macOS)或chrome.exe --version(Windows)直接获取版本号
二、离线下载最新版Headless Chrome
Headless Chrome无需单独下载,下载完整Chrome安装包即可(Chrome默认包含Headless模式),以下是不同系统的离线下载操作:
Windows系统
- 搜索“Chrome Windows离线安装包”,选择对应系统架构(x86/x64)的安装包下载
- 运行安装包完成安装后,默认主程序路径为
C:\Program Files\Google\Chrome\Application\chrome.exe
macOS系统
- 搜索“Chrome macOS离线dmg包”,下载对应版本的镜像文件
- 打开dmg文件,将Chrome拖拽到应用程序文件夹完成安装,默认主程序路径为
/Applications/Google Chrome.app/Contents/MacOS/Google Chrome
Linux系统(Debian/Ubuntu为例)
- 搜索“Chrome Debian离线deb包”,下载对应架构的deb文件
- 执行命令
sudo dpkg -i google-chrome-stable_current_amd64.deb完成安装,默认主程序路径为/usr/bin/google-chrome
三、在pyppeteer中指定新版本Chrome路径
安装完成后,修改executablePath参数指向新的Chrome主程序即可,示例代码:
from pyppeteer import launch import asyncio async def crawl_page(): browser = await launch( executablePath="/path/to/your/new/chrome", # 替换为实际安装路径 headless=True, args=['--no-sandbox', '--disable-setuid-sandbox'] # 可选,解决部分环境权限问题 ) page = await browser.newPage() await page.goto("https://example.com") # 此处添加你的爬取逻辑 await browser.close() asyncio.get_event_loop().run_until_complete(crawl_page())
内容的提问来源于stack exchange,提问作者thulasi39
相关产品推荐
相关产品推荐

