无法安装Nvidia Apex:OpenVid-1M环境配置报错求助
配置OpenVid-1M环境时Apex安装失败且触发transformers与Torch版本兼容错误
我在Windows的Linux虚拟机中配置OpenVid-1M项目环境,执行以下命令安装Nvidia Apex包时始终失败:
pip install -v --disable-pip-version-check --no-cache-dir --no-build-isolation --config-settings "--build-option=--cpp_ext" --config-settings "--build-option=--cuda_ext" git+https://github.com/NVIDIA/apex.git
当前环境信息
- CUDA版本:12.5(也曾尝试CUDA 11.8 + Torch 2.3.1的组合)
- 已安装的依赖版本:
colossalai==0.4.0 accelerate==0.32.1 diffusers==0.29.2 ftfy==6.2.0 gdown==5.2.0 mmengine==0.10.4 pre-commit==3.7.1 pyav==12.2.0 tensorboard==2.17.0 timm==1.0.7 tqdm==4.66.4 transformers==4.39.3 wandb==0.17.4 torch==2.2.2 torchvision==0.17.2 packaging==24.1 ninja==1.11.1.1
报错详情
执行项目脚本时触发如下错误:
[2024-07-12 04:57:25,233] torch.distributed.run: [WARNING] master_addr is only used for static rdzv_backend and when rdzv_endpoint is not specified. Traceback (most recent call last): File "/OpenVid-1M/scripts/inference.py", line 5, in <module> from mmengine.runner import set_random_seed File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/runner/__init__.py", line 2, in <module> from ._flexible_runner import FlexibleRunner File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/runner/_flexible_runner.py", line 14, in <module> from mmengine._strategy import BaseStrategy File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/_strategy/__init__.py", line 4, in <module> from .base import BaseStrategy File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/_strategy/base.py", line 19, in <module> from mmengine.model.wrappers import is_model_wrapper File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/model/__init__.py", line 6, in <module> from .base_model import BaseDataPreprocessor, BaseModel, ImgDataPreprocessor File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/model/base_model/__init__.py", line 2, in <module> from .base_model import BaseModel File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/model/base_model/base_model.py", line 9, in <module> from mmengine.optim import OptimWrapper File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/__init__.py", line 2, in <module> from .optimizer import (OPTIM_WRAPPER_CONSTRUCTORS, OPTIMIZERS, File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/optimizer/__init__.py", line 5, in <module> from .builder import (OPTIM_WRAPPER_CONSTRUCTORS, OPTIMIZERS, File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/optimizer/builder.py", line 174, in <module> TRANSFORMERS_OPTIMIZERS = register_transformers_optimizers() File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/optimizer/builder.py", line 165, in register_transformers_optimizers from transformers import Adafactor File "/conda/envs/venv/lib/python3.10/site-packages/transformers/__init__.py", line 26, in <module> from . import dependency_versions_check File "/conda/envs/venv/lib/python3.10/site-packages/transformers/dependency_versions_check.py", line 16, in <module> from .utils.versions import require_version, require_version_core File "/conda/envs/venv/lib/python3.10/site-packages/transformers/utils/__init__.py", line 33, in <module> from .generic import ( File "/conda/envs/venv/lib/python3.10/site-packages/transformers/utils/generic.py", line 478, in <module> _torch_pytree.register_pytree_node( AttributeError: module 'torch.utils._pytree' has no attribute 'register_pytree_node'. Did you mean: '_register_pytree_node'? [2024-07-12 04:57:30,430] torch.distributed.elastic.multiprocessing.api: [ERROR] failed (exitcode: 1) local_rank: 0 (pid: 112) of binary: /conda/envs/venv/bin/python Traceback (most recent call last): File "/conda/envs/venv/bin/torchrun", line 10, in <module> sys.exit(main()) File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/elastic/multiprocessing/errors/__init__.py", line 346, in wrapper return f(*args, **kwargs) File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/run.py", line 806, in main run(args) File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/run.py", line 797, in run elastic_launch( File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/launcher/api.py", line 134, in __call__ return launch_agent(self._config, self._entrypoint, list(args)) File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent raise ChildFailedError( torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
已尝试的无效方法
- 通过CUDA路径编译安装Apex,而非直接使用pip
- 克隆Apex不同旧分支进行编译安装
- 参考Stack Overflow及GitHub上的同类问题解决方案
安装Apex时始终提示failed to build wheel for apex,同时运行脚本触发上述AttributeError,求可行的技术解决方案。
内容的提问来源于stack exchange,提问作者Samit Manjunath
相关产品推荐
相关产品推荐

