基于Llama 2的笔记摘要Web应用Python服务提速优化求助
基于Llama 2的笔记摘要Web应用Python服务提速优化求助
我正在做一个基于Llama 2的笔记摘要器大学项目,现在碰到了头疼的问题:生成摘要的速度太慢了,居然要2分钟以上!想请大家帮我出出主意,优化Python服务的速度,这样才能配合React搭建的Web应用流畅运行。
我的核心问题
- 生成摘要的响应时间过长,超过2分钟,完全没法满足Web应用的使用需求
我已经尝试过的优化方法
- 模型量化版本调整:一开始用的是Llama 2-7B-Chat的GGML格式模型(8位量化的q8_0版本,文件大小7.16GB),后来换成了更低量化级别的模型,速度确实快了一点,但摘要的精准度掉得很明显,没法接受
- GPU加速尝试:试过用accelerate库让代码跑在GPU上,但提速效果没达到预期
我想要实现的目标
- 搭建一个React的笔记摘要Web应用,核心需求是Python后端能快速生成精准的摘要,兼顾速度和输出质量
我的Python代码片段
from langchain.prompts import PromptTemplate from langchain_community.llms import CTransformers import gr...
备注:内容来源于stack exchange,提问作者Glossy Power
相关产品推荐
相关产品推荐

