如何在AWS Sagemaker ml.t3.2xlarge实例中使用GPU?
AWS Sagemaker ml.t3.2xlarge 实例GPU使用问题解答
实例硬件属性说明
ml.t3.2xlarge属于AWS T3系列通用CPU计算实例,本身未搭载任何NVIDIA GPU硬件,天然不支持GPU加速计算。并非所有Sagemaker notebook实例都配备GPU,只有名称前缀为g、p、trn、inf的实例为AI加速类实例,例如ml.g4dn.xlarge、ml.p3.2xlarge等才会内置GPU硬件。
报错原因解释
你遇到的两个现象都是该实例的正常表现,不存在所谓「激活GPU」的操作:
- 运行
torch.cuda.is_available()返回False:PyTorch无法检测到CUDA硬件,自然返回不可用 - 运行
! nvidia-smi报错:实例底层无NVIDIA硬件,自然没有对应驱动,无法返回显卡信息
可选解决方案
- 若你仅做代码调试、小批量数据训练,不需要高算力支撑,可继续使用当前实例,直接用CPU运行PyTorch代码即可,无需额外调整
- 若你确实需要GPU加速训练,按以下步骤操作即可:
- 先停止当前运行的ml.t3.2xlarge notebook实例
- 进入实例编辑配置页,更换为带GPU的实例类型,性价比优先可选g4dn系列实例
- 重启实例后,选择内置CUDA版本的PyTorch内核,再次运行
torch.cuda.is_available()即可返回True,nvidia-smi也能正常输出显卡信息
内容的提问来源于stack exchange,提问作者Valdegg
相关产品推荐
相关产品推荐

