You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Gunicorn与Flask将ML模型加载至内存并共享给所有Worker

解决Gunicorn部署Flask API时ML模型跨Worker缓存问题

核心思路

Gunicorn的每个Worker是独立Python进程,无法共享内存对象,所以要让每个Worker启动时加载一次模型,同时避开Flask Blueprint导致的循环依赖。

具体实现步骤

1. 外层__init__.py仅负责创建Flask应用

外层folder/__init__.py代码:

from flask import Flask

def create_app():
    app = Flask(__name__)
    
    # 注册Blueprint,暂不关联模型逻辑
    from app.code_folder.v1.route import bp_v1
    app.register_blueprint(bp_v1, url_prefix='/v1')
    
    return app

2. 新增独立的模型加载模块

在app目录下创建model_loader.py,专门处理模型加载逻辑:

# app/model_loader.py
import os
import your_ml_lib  # 替换为实际使用的机器学习库(如torch/sklearn)

# 全局变量存储模型,每个Worker启动时会初始化一次
loaded_model = None

def load_model():
    global loaded_model
    if loaded_model is None:
        # 替换为你的模型路径和加载逻辑
        model_path = os.path.join(os.path.dirname(__file__), '../models/your_model.pkl')
        loaded_model = your_ml_lib.load(model_path)
    return loaded_model

3. 在业务代码中调用模型加载函数

app/code_folder/v1/controller/actual_code.py代码:

from app.model_loader import load_model

def predict(data):
    model = load_model()
    # 执行实际预测逻辑
    result = model.predict(data)
    return result

4. 修改启动入口,利用Gunicorn钩子触发模型加载

folder/app.py作为Gunicorn启动入口,通过post_fork钩子让每个Worker启动时加载模型:

from folder import create_app
from app.model_loader import load_model
import gunicorn.app.base

app = create_app()

class StandaloneApplication(gunicorn.app.base.BaseApplication):
    def __init__(self, app, options=None):
        self.options = options or {}
        self.application = app
        super().__init__()

    def load_config(self):
        config = {key: value for key, value in self.options.items()
                  if key in self.cfg.settings and value is not None}
        for key, value in config.items():
            self.cfg.set(key.lower(), value)

    def load(self):
        return self.application

def post_fork(server, worker):
    # 每个Worker启动时触发模型加载
    load_model()

if __name__ == '__main__':
    options = {
        'bind': '0.0.0.0:5000',
        'workers': 4,
        'post_fork': post_fork,
    }
    StandaloneApplication(app, options).run()

方案优势

  • 规避循环依赖:模型加载模块独立于Flask应用和Blueprint,无需在应用初始化阶段导入业务代码
  • 适配多Worker架构:每个Worker启动时仅加载一次模型,保证进程内模型可用
  • 性能优化:避免每次请求重复加载模型,降低资源消耗

内容的提问来源于stack exchange,提问作者Pallav Doshi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.20 21:45:10