常见表现:
nvidia-smi 正常,但 torch.cuda.is_available() 为 False/usr/local/cuda-11.8 和 cuda-12.1)libcudart.so.X not foundCUDA driver version is insufficientsymbol lookup error先确认三件事:
nvidia-smi # 看驱动版本
nvcc --version # 看 CUDA Toolkit 版本
python -c "import torch; print(torch.version.cuda)"⚠️ 注意:
nvidia-smi 显示的是 驱动支持的最高 CUDA 版本nvcc 才是你当前使用的 CUDA Toolkitsudo apt remove --purge cuda*
sudo apt remove --purge nvidia-cuda-toolkit或手动删除:
sudo rm -rf /usr/local/cuda*sudo apt remove --purge nvidia-*
sudo apt autoremove检查并删除重复或冲突的 CUDA 路径:
vim ~/.bashrc删除类似:
export PATH=/usr/local/cuda-11.8/bin:$PATH
export LD_LIBRARY_PATH=/usr/local/cuda-11.8/lib64:$LD_LIBRARY_PATH然后:
source ~/.bashrc适合 PyTorch / TensorFlow 用户
conda install pytorch torchvision torchaudio pytorch-cuda=12.1 -c pytorch -c nvidia✅ 优点:
sudo apt update
sudo apt install nvidia-driver-535重启:
reboot例如 CUDA 12.1:
sudo apt install cuda-toolkit-12-1export PATH=/usr/local/cuda/bin:$PATH
export LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH不要手动乱拷 .h 和 .so 文件。
✅ 推荐方式:
sudo apt install libcudnn8 libcudnn8-dev或 Conda:
conda install -c nvidia cudnnCUDA driver version is insufficient for CUDA runtime✅ 解决:
✅ 解决:
conda install cuda-nvcc✅ 解决:
/usr/local/cudaupdate-alternatives 管理(高级)nvidia-smi
nvcc --version
python -c "import torch; print(torch.cuda.is_available())"直接把下面信息发我即可:
系统:Ubuntu 20.04 / 22.04
显卡:RTX 3090 / A100 / ...
驱动版本:
CUDA 版本:
框架:PyTorch / TensorFlow
报错信息(如果有)