最近训练新增A100,gpu服务器,安装完cuda后突然出现torch无法正常使用,提示CUDA initialization: Unexpected error from cudaGetDeviceCount()错误,如下图所示:

- 进行分析和之前搭建的A800,GPU服务器进行对比,应该是没有安装 nvidia-fabricmanager 的问题,A100-80G需要使用nvlink & nvswitch来实现多卡互联,没有安装这个包GPU没法用如图所示:

A800机器:

A100机器:

- 检查gpu机器版本nvidia-smi,Driver Version: 535.183.01 ,下载相对应的安装包。
- 再次验证结果:

- Nvidia-fabricmanager 自动更新关闭,防止升级后无法进行使用。
编辑 dnf 配置文件,打开 /etc/dnf/dnf.conf 文件:
添加排除规则 在文件中添加一行 exclude=nvidia-fabricmanager*,如下所示:
保存并退出
保存文件并退出编辑器(在 nano 中,按 Ctrl+O 保存,按 Ctrl+X 退出)。
这将使 nvidia-fabricmanager 包不再被自动更新,直到你手动更新或移除该排除规则。



所有评论(0)