You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Linux下如何关闭浏览器流量压缩?Selenium爬取网站异常求助

解决Debian 9 GCE服务器上Selenium爬取特定网站异常的问题

看起来你遇到的问题大概率是目标网站对浏览器环境指纹或者请求压缩处理逻辑做了检测——毕竟本地Windows环境正常、其他网站也能爬,说明基础的Selenium和Xvfb配置是没问题的。下面给你几个针对性的排查和解决方向:

一、统一请求头的编码压缩配置

你已经尝试了Firefox设置accept-encoding为空,但可能没覆盖全,或者Chrome端没同步调整。建议直接复制你本地Windows浏览器的Accept-Encoding头值,让服务器端的Selenium浏览器和本地保持完全一致:

  • 针对Chrome,通过ChromeOptions添加自定义头:
    from selenium.webdriver.chrome.options import Options
    
    chrome_options = Options()
    # 复制你本地Chrome的User-Agent和Accept-Encoding
    chrome_options.add_argument('--user-agent=Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36')
    chrome_options.add_argument('accept-encoding=gzip, deflate, br')
    
  • 针对Firefox,修改浏览器偏好设置:
    from selenium.webdriver.firefox.options import Options
    
    firefox_options = Options()
    firefox_options.set_preference('general.useragent.override', 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:118.0) Gecko/20100101 Firefox/118.0')
    firefox_options.set_preference('network.http.accept-encoding', 'gzip, deflate, br')
    
    如果空值配置没用,就直接用本地浏览器的编码偏好值,避免网站对异常的Accept-Encoding做拦截。

二、模拟更真实的浏览器环境(反指纹检测)

很多网站会识别无头模式、自动化工具标识,或者通过屏幕尺寸、系统信息判断是否是爬虫环境:

  • 优化Chrome无头模式配置,让它更接近真实浏览器:
    chrome_options.add_argument('--headless=new')  # 新版无头模式更贴近正常浏览器行为
    chrome_options.add_argument('--window-size=1920x1080')  # 和本地屏幕分辨率一致
    chrome_options.add_argument('--disable-blink-features=AutomationControlled')
    chrome_options.add_experimental_option('excludeSwitches', ['enable-automation'])
    chrome_options.add_experimental_option('useAutomationExtension', False)
    
  • Firefox同理,禁用自动化标识:
    firefox_options.set_preference('dom.webdriver.enabled', False)
    firefox_options.set_preference('useAutomationExtension', False)
    
  • 调整Xvfb的启动参数,确保显示环境和本地一致:
    启动Xvfb时指定和本地相同的分辨率:
    Xvfb :1 -screen 0 1920x1080x24 &
    export DISPLAY=:1
    
    再启动Selenium,避免网站通过屏幕尺寸检测异常。

三、检查服务器网络与依赖

目标网站可能对GCE IP段有特殊限制,或者服务器缺少浏览器压缩处理的依赖:

  • 先用curl模拟本地请求,测试服务器网络是否能正常获取内容:
    curl -H "Accept-Encoding: gzip, deflate, br" -H "User-Agent: 你的本地浏览器UA" https://目标网站地址
    
    如果curl返回正常,说明问题出在Selenium的浏览器配置;如果curl也异常,大概率是IP被限制,需要考虑更换IP或者添加代理。
  • 安装浏览器压缩依赖库,确保能正常解析压缩响应:
    sudo apt-get update && sudo apt-get install libz-dev libbz2-dev
    

四、对比请求差异定位问题

用本地浏览器的开发者工具和服务器Selenium的日志,对比请求头、响应头的差异:

  • 开启Chrome的性能日志,捕获请求详情:
    chrome_options.set_capability('goog:loggingPrefs', {'performance': 'ALL'})
    driver = webdriver.Chrome(options=chrome_options)
    driver.get("目标网站地址")
    # 导出日志后和本地请求对比
    logs = driver.get_log('performance')
    
    重点对比Accept-Encoding、User-Agent、Accept-Language这些容易被检测的字段,确保服务器端和本地完全一致。

我之前遇到过几乎一模一样的情况——就是因为无头模式的浏览器标识被网站识别,加上Accept-Encoding配置和本地不一致,导致返回异常内容,调整后就恢复正常了,你可以按这个思路试试。

内容的提问来源于stack exchange,提问作者Glad Born

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 08:34:56