训练机器cuda环境配置
基础知识: CUDA与cuDNN
基于Nvidia GPU深度学习服务器如何完成驱动和CUDA环境配置,这里通过自身实践,总结了这份文档供大家参考同时也供自己备忘。
1.验证GPU是否支持CUDA
lspci | grep -i nvidia
如下输出显示NVIDIA GPU信息,说明支持CUDA。
2.查看系统的内核版本
uname -a 查看系统的发行linux版本和对应的内核版本,这些信息在下一步中从nvidia官网选则对应版本的驱动时会用得上。如图所示,该系统是基于linux 5.10版本的linux系统:
对应的linux发行版本可以,从/etc/*-release 查看,如下图所示本系统是基于redhat 7.2版本的内核
3.安装NVIDIA驱动和CUDA
nvidia官方驱动地址根据系统版本选择:Nvidia run 文件
卸载旧版本驱动(如果有):sudo /usr/bin/nvidia-uninstall
安装对应版本的驱动: sudo sh NVIDIA-Linux-x86_64-535.129.03.run
输入 accept

选择对应要安装的cuda工具,图示选中了driver和cuda toolki

4. 安装验证
- 重启系统
sudo reboot - 查看cuda toolkit工具版本
nvcc --version,图示版本为V12.2.140
- 查看nvidia显卡使用信息
nvidia-smi,图示为4 * V100
恭喜你完成了所有的安装步骤,可以愉快地使用gpu了。
5.QA
1、安装driver是会报编译错误
可能的原因有两种:一是系统内核版本不匹配(过高或者过低),则需要升级/降级版本;二可能是系统自带gcc版本太低,升级一下gcc再此重试。
2、重试多次仍然无法解决
如果一种方法行不通,比如通过使用 .run 文件安装失败,可以尝试一下其他方法,比如 rpm local 或者 rpm network。
欢迎来到FlagOS开发社区,这里是一个汇聚了AI开发者、数据科学家、机器学习爱好者以及业界专家的活力平台。我们致力于成为业内领先的Triton技术交流与应用分享的殿堂,为推动人工智能技术的普及与深化应用贡献力量。
更多推荐



所有评论(0)