Python中Selenium结合Flask/Falcon部署后返回502 Bad Gateway错误咨询
问题根源
你遇到的502错误和框架、Nginx无关,核心是gunicorn的请求超时机制被触发了。
gunicorn默认对单个请求设置了超时阈值(默认30秒),如果请求处理时间超过这个阈值,gunicorn主进程会直接杀掉处理该请求的worker进程,导致无法正常返回响应,抛出502错误。你加了time.sleep(5)之后,加上Selenium启动无头浏览器、加载页面的耗时,总处理时间超过了gunicorn的默认超时限制,所以触发报错;删掉time.sleep后总耗时低于阈值,就能正常返回,但此时页面未加载完成导致抓取结果不准。
解决方法
1. 调整gunicorn超时配置
启动gunicorn时添加--timeout参数延长超时时间,比如设置为120秒,足够覆盖Selenium启动、页面加载的全流程耗时:
gunicorn --timeout 120 -w 2 your_app_entry:app
如果是用配置文件启动gunicorn,就添加配置项timeout = 120。
2. 替换time.sleep为Selenium显式等待
固定等待5秒的方式非常低效,换成显式等待可以在目标元素加载完成后立刻执行后续逻辑,既缩短请求耗时,又能保证抓取结果准确:
修改对应代码段如下:
from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from selenium.webdriver.common.by import By driver.get(url) result = False # 最多等待10秒,直到目标a标签加载完成 try: WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.XPATH, "//a[@class='_52c6']")) ) result = True except: result = False
3. 优化gunicorn worker配置
如果使用异步worker(比如gevent),需要在应用入口最顶部添加猴子补丁,避免time.sleep这类阻塞调用卡住事件循环:
# 放在所有import的最前面 from gevent import monkey monkey.patch_all()
如果使用默认同步worker,建议将worker数量设置为CPU核心数*2 + 1,避免worker不足导致请求排队超时。
4. 优化Selenium驱动复用
当前代码每次请求都要启动、销毁Firefox进程,非常消耗资源且拉长请求耗时。建议使用单例模式维护全局驱动实例,或者搭建驱动池复用已启动的驱动,能大幅降低单请求的处理时间。
内容的提问来源于stack exchange,提问作者Thiago
相关产品推荐
相关产品推荐

