在AWS Inf1实例上编译Llama-2模型的技术求助
Inf1实例运行Llama-2推理的问题与疑问
背景信息
- 目标:运行Llama-2 7B、13B聊天模型的推理任务
- 使用实例:Inf1.6xlarge
- 基础环境:Ubuntu 20.04系统,采用Deep Learning AMI Neuron PyTorch 1.13镜像
- 操作流程:
- 按照AWS Neuron官方PyTorch配置指南完成实例初始化配置
- 参考Llama-2-13B采样教程执行推理操作,过程中出现Neuron运行时错误
- 尝试按Inf1实例专属安装指南重新配置环境,但运行采样代码仍触发Neuron错误
待解答问题
- 如何解决上述Neuron运行时错误?
transformers-neuronx包是否支持Inf1实例?若不支持,该如何使用neuron-cc编译Llama-2模型?- 通过
torch.jit.trace和torch.neuron.trace函数结合neuron-cc编译模型的方式,是否适用于Llama-2模型?
内容的提问来源于stack exchange,提问作者Nitheeswaran B
相关产品推荐
相关产品推荐

