在 ComfyUI 里做模型量化,本质上和底层模型格式(Checkpoint / safetensors / GGUF / ONNX 等)强相关。下面按常用、稳定、效果好的方式给你梳理一套实战向的方案。
一、最推荐的通用方案(Stable Diffusion 类)
✅ 1. GGUF 量化(目前最主流)
适用:ComfyUI + Stable Diffusion / SDXL / Flux
- 工具:
llama.cpp 风格导出(SD 社区已支持)- ComfyUI-GGUF
- 常见量化等级:
Q4_K_S(推荐,体积/质量平衡)Q5_K_MQ8_0(几乎无损)- 优点:
- 显存占用大幅下降
- ComfyUI 原生支持
- 推理速度提升明显
- 缺点:
- 需要先转换模型
✅ 新手首选
✅ 2. safetensors + fp16 / bf16(不算“量化”但最稳)
- 不量化,只降精度
- ComfyUI 默认支持
- 适合:
- 显存 ≥ 8G
- 对画质要求高
二、UNet / DiT 专用量化(进阶)
✅ 3. fp8(H100 / 40系显卡友好)
- 支持:
- ComfyUI(部分节点)
- Flux / SD3
- 优点:
- 几乎无损
- 显存省 30%~50%
- 条件:
- 需要 CUDA 12+ / 新驱动
✅ 4. TensorRT 量化(最快但最麻烦)
- 工具:
ComfyUI-TensorRT- 支持:
- fp16 / int8
- 优点:
- 推理极快
- 缺点:
- 配置复杂
- 模型绑定硬件
三、LLM / 控制类模型量化(如 LLM Node)
✅ 5. GGUF(LLM)
- 用在:
- 提示词生成
- 自动工作流
- 推荐:
Q4_K_MQ5_K_M
四、不推荐的量化方式(踩坑提醒)
❌ 直接对 Checkpoint 做 int8
❌ 老式 pth 量化
❌ 随意用未知节点压缩
容易导致:
五、实用建议(经验向)
- 画质优先:Q8 / fp8
- 显存不够:Q4_K_S
- Flux:GGUF + fp8 组合
- SDXL:GGUF 最稳
如果你愿意,我可以:
- 给你 具体模型(Flux / SDXL)的量化命令
- 或帮你 选最适合你显卡的方案
你现在是用的什么显卡和模型?