如何用Gunicorn与Flask将ML模型加载至内存并共享给所有Worker
解决Gunicorn部署Flask API时ML模型跨Worker缓存问题
核心思路
Gunicorn的每个Worker是独立Python进程,无法共享内存对象,所以要让每个Worker启动时加载一次模型,同时避开Flask Blueprint导致的循环依赖。
具体实现步骤
1. 外层__init__.py仅负责创建Flask应用
外层folder/__init__.py代码:
from flask import Flask def create_app(): app = Flask(__name__) # 注册Blueprint,暂不关联模型逻辑 from app.code_folder.v1.route import bp_v1 app.register_blueprint(bp_v1, url_prefix='/v1') return app
2. 新增独立的模型加载模块
在app目录下创建model_loader.py,专门处理模型加载逻辑:
# app/model_loader.py import os import your_ml_lib # 替换为实际使用的机器学习库(如torch/sklearn) # 全局变量存储模型,每个Worker启动时会初始化一次 loaded_model = None def load_model(): global loaded_model if loaded_model is None: # 替换为你的模型路径和加载逻辑 model_path = os.path.join(os.path.dirname(__file__), '../models/your_model.pkl') loaded_model = your_ml_lib.load(model_path) return loaded_model
3. 在业务代码中调用模型加载函数
app/code_folder/v1/controller/actual_code.py代码:
from app.model_loader import load_model def predict(data): model = load_model() # 执行实际预测逻辑 result = model.predict(data) return result
4. 修改启动入口,利用Gunicorn钩子触发模型加载
folder/app.py作为Gunicorn启动入口,通过post_fork钩子让每个Worker启动时加载模型:
from folder import create_app from app.model_loader import load_model import gunicorn.app.base app = create_app() class StandaloneApplication(gunicorn.app.base.BaseApplication): def __init__(self, app, options=None): self.options = options or {} self.application = app super().__init__() def load_config(self): config = {key: value for key, value in self.options.items() if key in self.cfg.settings and value is not None} for key, value in config.items(): self.cfg.set(key.lower(), value) def load(self): return self.application def post_fork(server, worker): # 每个Worker启动时触发模型加载 load_model() if __name__ == '__main__': options = { 'bind': '0.0.0.0:5000', 'workers': 4, 'post_fork': post_fork, } StandaloneApplication(app, options).run()
方案优势
- 规避循环依赖:模型加载模块独立于Flask应用和Blueprint,无需在应用初始化阶段导入业务代码
- 适配多Worker架构:每个Worker启动时仅加载一次模型,保证进程内模型可用
- 性能优化:避免每次请求重复加载模型,降低资源消耗
内容的提问来源于stack exchange,提问作者Pallav Doshi
相关产品推荐
相关产品推荐

