You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

无法安装Nvidia Apex:OpenVid-1M环境配置报错求助

配置OpenVid-1M环境时Apex安装失败且触发transformers与Torch版本兼容错误

我在Windows的Linux虚拟机中配置OpenVid-1M项目环境,执行以下命令安装Nvidia Apex包时始终失败:

pip install -v --disable-pip-version-check --no-cache-dir --no-build-isolation --config-settings "--build-option=--cpp_ext" --config-settings "--build-option=--cuda_ext" git+https://github.com/NVIDIA/apex.git

当前环境信息

  • CUDA版本:12.5(也曾尝试CUDA 11.8 + Torch 2.3.1的组合)
  • 已安装的依赖版本:
colossalai==0.4.0
accelerate==0.32.1
diffusers==0.29.2
ftfy==6.2.0
gdown==5.2.0
mmengine==0.10.4
pre-commit==3.7.1
pyav==12.2.0
tensorboard==2.17.0
timm==1.0.7
tqdm==4.66.4
transformers==4.39.3
wandb==0.17.4

torch==2.2.2
torchvision==0.17.2
packaging==24.1
ninja==1.11.1.1

报错详情

执行项目脚本时触发如下错误:

[2024-07-12 04:57:25,233] torch.distributed.run: [WARNING] master_addr is only used for static rdzv_backend and when rdzv_endpoint is not specified.
Traceback (most recent call last):
  File "/OpenVid-1M/scripts/inference.py", line 5, in <module>
    from mmengine.runner import set_random_seed
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/runner/__init__.py", line 2, in <module>
    from ._flexible_runner import FlexibleRunner
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/runner/_flexible_runner.py", line 14, in <module>
    from mmengine._strategy import BaseStrategy
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/_strategy/__init__.py", line 4, in <module>
    from .base import BaseStrategy
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/_strategy/base.py", line 19, in <module>
    from mmengine.model.wrappers import is_model_wrapper
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/model/__init__.py", line 6, in <module>
    from .base_model import BaseDataPreprocessor, BaseModel, ImgDataPreprocessor
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/model/base_model/__init__.py", line 2, in <module>
    from .base_model import BaseModel
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/model/base_model/base_model.py", line 9, in <module>
    from mmengine.optim import OptimWrapper
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/__init__.py", line 2, in <module>
    from .optimizer import (OPTIM_WRAPPER_CONSTRUCTORS, OPTIMIZERS,
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/optimizer/__init__.py", line 5, in <module>
    from .builder import (OPTIM_WRAPPER_CONSTRUCTORS, OPTIMIZERS,
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/optimizer/builder.py", line 174, in <module>
    TRANSFORMERS_OPTIMIZERS = register_transformers_optimizers()
  File "/conda/envs/venv/lib/python3.10/site-packages/mmengine/optim/optimizer/builder.py", line 165, in register_transformers_optimizers
    from transformers import Adafactor
  File "/conda/envs/venv/lib/python3.10/site-packages/transformers/__init__.py", line 26, in <module>
    from . import dependency_versions_check
  File "/conda/envs/venv/lib/python3.10/site-packages/transformers/dependency_versions_check.py", line 16, in <module>
    from .utils.versions import require_version, require_version_core
  File "/conda/envs/venv/lib/python3.10/site-packages/transformers/utils/__init__.py", line 33, in <module>
    from .generic import (
  File "/conda/envs/venv/lib/python3.10/site-packages/transformers/utils/generic.py", line 478, in <module>
    _torch_pytree.register_pytree_node(
AttributeError: module 'torch.utils._pytree' has no attribute 'register_pytree_node'. Did you mean: '_register_pytree_node'?
[2024-07-12 04:57:30,430] torch.distributed.elastic.multiprocessing.api: [ERROR] failed (exitcode: 1) local_rank: 0 (pid: 112) of binary: /conda/envs/venv/bin/python
Traceback (most recent call last):
  File "/conda/envs/venv/bin/torchrun", line 10, in <module>
    sys.exit(main())
  File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/elastic/multiprocessing/errors/__init__.py", line 346, in wrapper
    return f(*args, **kwargs)
  File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/run.py", line 806, in main
    run(args)
  File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/run.py", line 797, in run
    elastic_launch(
  File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/launcher/api.py", line 134, in __call__
    return launch_agent(self._config, self._entrypoint, list(args))
  File "/conda/envs/venv/lib/python3.10/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
    raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:

已尝试的无效方法

  • 通过CUDA路径编译安装Apex,而非直接使用pip
  • 克隆Apex不同旧分支进行编译安装
  • 参考Stack Overflow及GitHub上的同类问题解决方案

安装Apex时始终提示failed to build wheel for apex,同时运行脚本触发上述AttributeError,求可行的技术解决方案。

内容的提问来源于stack exchange,提问作者Samit Manjunath

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.21 07:24:54