autodl容器里安装cuda和cudnn以及下载mamba模型
我的论文有关时序 老师说要用mamba模型看看 但是我是win系统 虽然也已经安装好了 但是带不起来 很慢 于是只能在autodl里面跑 所以要重新下载cuda和cudnn以及其他各种库 找了很多教程以及官方的文档 在autodl里面可以运行了
这里参考了一篇Linux下载mamba的文章 Linux下载mamba
一、cuda和cudnn下载
1.首先在官网找到下载链接 因为模型需要的配置是py3.1.0 cuda11.8 cudnn8.9.6(这是我的下载)cuda11.8 和 cudnn8.9.6 选择Tar这个压缩包

这里要创建容器实例之前 选择的镜像是 minconda3 python3.1.0 cuda11.8(按照这个顺序找)
2.接下来下载好之后 将下载的上传到你打开的实例里面 上传到这里面 不过有个弊端就是 磁盘很容易爆炸(因为清磁盘所以我的给删掉了)

3.打开这里的终端 我没有新建虚拟环境 如果可以的话 也可以看官方怎么新建然后切换

4.安装cuda
安装cuda 在终端输入这两条指令 其中.run是你下载的 我这里是这个名字 根据你的实际名字来输入输入第一条之后 就有了权限 紧接着 在输入第二条 这里是让你安装 会出现一个对话框 这里我没有截图 口述一下 看见第一个对话框 是输入accept 让你接受 然后就到了 安装 这里不用安装驱动 所以对话框的前两行取消勾选 按空格就可以 按其中一个就可以取消前两个的勾选 之后 一定要确认一下cuda11.8是否被勾选了 其他的不用管 然后往下选择安装 会出现你已经安装了是否还需要 这里选第一个 应该是重新安装 然后等待他安装成功就可以
chmod +x cuda_11.8.0_520.61.05_linux.run
./cuda_11.8.0_520.61.05_linux.run
这个是安装成功的输出 因为我问的gpt 所以只有这个截图

5.第二个是cudnn的安装
(1)首先要解压.tar.xz 输入这条指令就可以了
tar -xf cudnn-linux-x86_64-8.9.6.50_cuda11-archive.tar.xz
可以看到cudnn-linux.....这个文件夹

(2)然后把里面的文件复制到cuda文件里面 输入下面第一行的两个指令就可以复制 也可以输入第二行的两个指令检查一下有没有复制进去如果成功复制 你就可以看到他列出了cuda里面的这些文件 都是来自cudnn
# 拷贝到 CUDA 目录
sudo cp cudnn-linux-x86_64-8.9.6.50_cuda11-archive/include/* /usr/local/cuda/include/
sudo cp cudnn-linux-x86_64-8.9.6.50_cuda11-archive/lib/* /usr/local/cuda/lib64/
ls /usr/local/cuda/include | grep cudnn
ls /usr/local/cuda/lib64 | grep libcudnn
(3)cuda和cudnn都已经下载好了 接下来就是弄到容器环境里面去
echo -e "\n# CUDA and cuDNN environment\nexport PATH=/usr/local/cuda/bin:\$PATH\nexport LD_LIBRARY_PATH=/usr/local/cuda/lib64:\$LD_LIBRARY_PATH" >> ~/.bashrc
释放立即生效
source ~/.bashrc
检查一下是否存在
echo $PATH
echo $LD_LIBRARY_PATH
然后可以看到下面 cuda和cudnn就已经在里面了

二、环境都配置好了 那就是mamba的下载了
1.这里要下载几个轮子 我是用了大佬的 很方便 下载就可以了 轮子
2.这个链接里也是对应的教程 (从4开始到最后 2-3不需要 1是下载链接)pip这些就可以 但是有些出现的问题
(1)首先因为磁盘爆炸 很难下载成功 在fs里面新建一个文件夹 这里我命名为data 我把轮子都下载到这个文件里了 但是有个bug 我明明放在了fs里面 但是检索到的位置确实data 这里要注意分辨 可以输入指令查看一下 gpt问一下指令就ok

(2)所以在安装的时候 告诉系统 不放在磁盘里 暂时将他们存储在临时文件里 就是data里面
然后输入下面的指令
export TMPDIR=/autodl-fs/data
mkdir -p /autodl-fs/data
这里我想了一下 我在输入这两个指令之前就创建了data 所以在输入之后 先设置临时存放 又创建了他 所以系统就将这些轮子放在了里面(如果思路有错误请帮我纠正 感谢)但是问题不大 就按照这个思路来 指令是对的 如果下面pip安装不对 那应该就是这些轮子存放地方不对 找出他的位置就ok 就是一开始说的要先检索存放的位置 在执行上面两条指令后 以防万一再检查一遍路径 有时候路径是最大的错误
(3)根据大佬的教程 逐步安装 唯一不同的是存放的地方 安装完所需要的依赖
pip install --no-cache-dir /autodl-fs/data/torchvision-0.19.1+cu118-cp310-cp310-linux_x86_64.whl
pip install --no-cache-dir /autodl-fs/data/torchaudio-2.4.1+cu118-cp310-cp310-linux_x86_64.whl
pip install --no-cache-dir /autodl-fs/data/torch-2.4.1+cu118-cp310-cp310-linux_x86_64.whl
然后是模型
pip install --no-cache-dir /autodl-fs/data/mamba_ssm-2.2.1+cu118torch2.4cxx11abiFALSE-cp310-cp310-linux_x86_64.whl
pip install --no-cache-dir /autodl-fs/data/causal_conv1d-1.3.0.post1+cu118torch2.4cxx11abiFALSE-cp310-cp310-linux_x86_64.whl
(4)逐步执行这些指令 安装成功 那么模型就下载好了 然后验证一下
import torch
import causal_conv1d_cuda
import torch
import selective_scan_cuda
根据大佬的文章验证的结果可以看到这个

基本上按照这个流程一步一步 是没有问题的 大多数是环境问题 可以复制下来问gpt 官网的一些代码 在我的容器终端报错 所以复制问了gpt运行成功的 官方文档按照cuda和cudnn 这是官网的网址 可以对照看一下
欢迎来到FlagOS开发社区,这里是一个汇聚了AI开发者、数据科学家、机器学习爱好者以及业界专家的活力平台。我们致力于成为业内领先的Triton技术交流与应用分享的殿堂,为推动人工智能技术的普及与深化应用贡献力量。
更多推荐



所有评论(0)