提升 ComfyUI 模型运行速度的核心在于优化硬件资源利用率(显存、内存、算力)以及精简工作流。最直接有效的方案通常是开启硬件加速、使用模型量化技术以及调整显存管理策略。
以下是分维度的详细优化方案:
这是提升速度的基础,确保软件能发挥硬件的最大性能。
--cpu 模式(除非是纯 CPU 推理)。通过修改 run_nvidia_gpu.bat(或对应启动脚本)中的 COMFYUI_ARGS,可以显著改变显存占用和速度。
| 参数 | 适用场景 | 说明 |
|---|---|---|
--lowvram | 显存 < 8GB | 强制模型分块加载,牺牲少量速度换取更低显存占用。 |
--medvram | 显存 8GB - 12GB | 平衡显存和速度,适合大多数消费级显卡。 |
--highvram | 显存 > 16GB | 强制将整个模型加载到显存,速度最快,但可能导致其他应用卡顿。 |
--preview-method auto | 通用 | 自动选择最快的预览方式(通常是 latent 预览),减少预览图生成带来的延迟。 |
--disable-smart-memory | 大显存用户 | 禁用智能显存管理,防止模型在显存中反复加载/卸载,提升连续出图速度。 |
--bf16 / --fp16 | 通用 | 根据显卡支持情况选择精度,BF16 通常在现代显卡上更快且更稳定。 |
模型本身的大小和加载方式直接影响推理速度。
fp16 或 q8 等量化版本,能大幅降低显存占用并提升推理速度。sd3.5_fp8.safetensors),相比 FP16/BF16,FP8 在 Ada Lovelace 架构(40系显卡)及 Hopper 架构上速度极快。Load Checkpoint 时,如果只生成图片,考虑使用 Load LoRA 配合基础模型,避免加载不必要的 CLIP 或 VAE 组件(虽然 ComfyUI 通常已优化,但精简节点有助于速度)。杂乱或冗余的工作流会拖慢执行效率。
Mute 功能)。VAE Decode (Tiled) 处理高分辨率图片,避免一次性解码导致显存溢出和速度骤降。batch_size 通常比单张循环生成效率更高(前提是显存够用)。Primitive 或 Reroute 节点整理连线,避免同一个计算节点被多次调用。ComfyUI-TeaCache 节点。它通过缓存模型中间层输出来减少重复计算,在不改变模型的情况下提升约 20%-30% 的速度(尤其适合 Flux 和 SD3.5)。Tiled KSampler 或 Tiled Diffusion 插件,将图片分块处理。Free GPU Memory 节点(虽然 ComfyUI 会自动管理,但在复杂流程中手动清理有助于防止 OOM)。如果速度依然很慢,请检查以下瓶颈:
Latent 或 None。总结建议:优先尝试更新驱动、使用 GGUF 或 FP8 模型,并根据显存大小调整启动参数(如 --medvram)。如果追求极致速度,引入 LCM 加速 或 TeaCache 插件 是最有效的手段。