怎么优化CentOS装SD性能

AI技术
小华
2026-08-22

在 CentOS 上优化 Stable Diffusion(SD) 的性能,核心目标是:让 GPU 跑满、减少 CPU/IO 瓶颈、提升显存和内存利用率。下面按「系统 → 驱动 → Python/环境 → SD 本身 → 进阶」给你一套可操作的优化清单。

一、系统层优化(CentOS 必备)

1️⃣ 关闭 SELinux(减少莫名权限问题)

getenforce
sudo setenforce 0
sudo sed -i 's/^SELINUX=.*/SELINUX=disabled/' /etc/selinux/config

2️⃣ 调整系统资源限制

编辑:

sudo vi /etc/security/limits.conf

追加:

* soft nofile 65535
* hard nofile 65535
* soft nproc 65535
* hard nproc 65535

3️⃣ 关闭不必要的服务

sudo systemctl disable firewalld
sudo systemctl stop firewalld

(如果是服务器,建议用安全组而不是本地防火墙)

二、GPU & 驱动优化(最关键)

1️⃣ 确认 GPU 状态

nvidia-smi

✅ 正常情况:

  • 能看到 GPU
  • 驱动版本 ≥ 525(推荐 535+)
  • CUDA Version 显示正常

2️⃣ 安装 官方 NVIDIA 驱动(不要用 nouveau)

sudo yum install -y epel-release
sudo yum install -y kernel-devel gcc

禁用 nouveau:

echo "blacklist nouveau" | sudo tee /etc/modprobe.d/blacklist-nouveau.conf
sudo dracut --force
reboot

然后安装官方驱动(示例):

sudo sh NVIDIA-Linux-x86_64-535.xx.run

3️⃣ 安装 CUDA + cuDNN(强烈推荐)

  • CUDA:11.8 或 12.x(Stable Diffusion 最稳)
  • cuDNN:对应 CUDA 版本

验证:

nvcc --version

三、Python & 环境优化(性能提升明显)

✅ 强烈建议:使用 Miniconda

wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh

创建专用环境:

conda create -n sd python=3.10 -y
conda activate sd

✅ 使用 PyTorch CUDA 版本(不是 CPU)

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

验证:

import torch
print(torch.cuda.is_available())

✅ 必须是 True

四、Stable Diffusion 本身优化(重点)

1️⃣ 使用 xformers(强烈推荐)

显存占用 ↓,速度 ↑
pip install xformers

启动参数:

--xformers

2️⃣ 启动参数优化(WebUI 为例)

python launch.py \
--xformers \
--medvram \
--no-half-vae \
--opt-sdp-attention

参数说明:

参数作用
--xformers加速 attention
--medvram中等显存优化
--lowvram显存 < 6G
--no-half-vae防止色块
--opt-sdp-attention新 GPU 更快

3️⃣ 模型 & 精度优化

✅ 推荐使用:

  • FP16 模型
  • 避免 FP32(慢且吃显存)

例如:

v1-5-pruned-emaonly.safetensors

五、存储 & IO 优化(很多人忽略)

1️⃣ 模型放 SSD

df -h

❌ 机械盘 = 加载模型慢 + 生成卡顿

2️⃣ 减少模型重复加载

  • 不要频繁切换模型
  • 开启:
--api

用于自动化调用

六、内存 & 交换优化(大图必备)

1️⃣ 增加 swap(防止 OOM)

sudo fallocate -l 16G /swapfile
sudo chmod 600 /swapfile
sudo mkswap /swapfile
sudo swapon /swapfile

七、进阶性能压榨(可选)

✅ 使用 TensorRT(最快)

  • 适合固定模型
  • 速度提升 30–80%
  • 配置复杂(适合生产)

✅ 多卡(不推荐新手)

  • SD 对多 GPU 支持一般
  • 更适合推理服务拆分

八、推荐配置参考

项目推荐
OSCentOS 7/8
GPURTX 3060 及以上
显存≥ 8G
CUDA11.8
Python3.10
PyTorch2.x + CUDA

九、快速自检清单 ✅

nvidia-smi
python - <

如果你愿意,可以告诉我:

  • ✅ GPU 型号 & 显存
  • ✅ 用的是 WebUI / ComfyUI / 命令行
  • ✅ CentOS 版本

我可以直接给你 一套最适合你机器的启动参数和配置

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序