提升 ComfyUI 的模型推理速度,可以从硬件、模型、参数、工作流、软件配置几个层面系统性优化。下面按“最容易见效 → 进阶优化”的顺序说明。
一、硬件与基础环境(最直接)
1. 使用合适的 GPU
- NVIDIA GPU 效果最好(CUDA + TensorRT)
- 显存越大越好:
- 生成 512×512:≥6GB
- 生成 1024×1024:≥12GB
- SDXL / 视频模型:≥16–24GB
2. 使用 SSD + 足够内存
- 模型加载慢通常是磁盘 IO问题
- 模型放 NVMe SSD
- 内存建议 ≥32GB
3. 驱动与运行库
- 更新 NVIDIA 驱动
- 使用匹配版本的:
- CUDA
- cuDNN
- PyTorch(ComfyUI 推荐 torch 2.x)
二、ComfyUI 启动参数优化(非常重要)
推荐启动命令(Windows / Linux)
python main.py --highvram --force-fp16 --disable-smart-memory
常用参数说明:
| 参数 | 作用 |
|---|
--highvram | 全程占用显存,减少来回搬运 |
--normalvram | 显存不足时使用 |
--lowvram | 极低显存(慢) |
--force-fp16 | 半精度推理(更快更省显存) |
--bf16 | Ampere+ GPU 更稳定 |
--disable-smart-memory | 避免频繁释放模型 |
--cuda-malloc | 减少显存碎片 |
⚠️ 如果你显存 ≤8GB,不要强行 highvram
三、模型层面的优化(效果明显)
1. 使用更快的模型格式
- ✅ safetensors(比 ckpt 快且安全)
- ✅ 使用 fp16 / bf16 模型
- ❌ 避免 fp32 模型
2. 使用轻量模型
- SD1.5 > SDXL(速度)
- Turbo / LCM / Lightning 模型:
SDXL TurboLCMSD 1.5 Lightning
3. 使用 LoRA 而非全模型
四、采样器与步数优化(立竿见影)
1. 减少采样步数
- 普通模型:20–30 步
- Turbo / LCM:4–8 步
2. 使用高效采样器
推荐:
Euler aDPM++ 2M KarrasLCM / Turbo 专用采样器
❌ 避免:
五、分辨率与批处理优化
1. 控制分辨率
- 1024×1024 比 512×512 慢 4倍
- 尽量在模型原生分辨率附近
2. 合理使用 batch_size
- 一次出多张图:
batch_size = 2~4- 不要超过显存上限
六、ComfyUI 专属加速方案(进阶)
1. 使用 TensorRT(最快)
- 仅 NVIDIA
- 可提升 30%–100%
- 需要:
- TensorRT 节点
- 模型转换(一次性的)
2. 使用 xFormers
启动参数:
--xformers
✅ 显存更省,速度更快
3. 使用 torch.compile(PyTorch 2.x)
--torch-compile
⚠️ 第一次慢,后续快
七、工作流层面的优化
1. 避免无用节点
- 不要同时跑:
- 多个 VAE
- 多个 controlnet
- 关闭不需要的 preview
2. 控制预处理数量
- ControlNet / IPAdapter 越多越慢
- 能后置的就后置
八、快速检查清单(性能瓶颈判断)
| 现象 | 可能原因 |
|---|
| 出图前卡很久 | 模型加载 / 磁盘慢 |
| 显存爆 | 分辨率 / 模型太大 |
| 中途卡顿 | smart memory / 节点过多 |
| CPU 占用高 | xformers 没开 |
九、推荐“最快组合”
SDXL Lightning + fp16 + xformers + highvram + 8步
如果你是:
可以直接告诉我你的:
✅ GPU 型号
✅ 显存大小
✅ 用的模型
✅ 当前启动参数
我可以给你一套定制优化方案。