ComfyUI 常见模型类型:
| 模型类型 | 常见格式 | 量化方式 |
|---|---|---|
| SD1.5 / SDXL | .safetensors | FP16 / FP8 / INT8 |
| FLUX / SD3 | .safetensors | FP8 / GGUF |
| LoRA | .safetensors | 通常不量化 |
| LLM(如用 ComfyUI 跑语言模型) | GGUF | GGUF 量化 |
| 扩散模型 + 推理加速 | AWQ / GPTQ |
适合:SDXL / FLUX / SD3 / 40 系列显卡
Load Checkpoint → fp8_e4m3fn或在 extra_model_paths.yaml 中设置默认精度。
适合:低显存 / FLUX.1 / 本地部署
| 等级 | 显存占用 | 质量 |
|---|---|---|
| Q4_K_M | 低 | ✅ 推荐 |
| Q5_K_M | 中 | 更好 |
| Q8_0 | 高 | 接近 FP16 |
flux1-dev-Q4_K_M.ggufLoad GGUF Model适合:SD1.5 / 老显卡
comfyui_bitsandbytesLoad Checkpoint (bnb)一般不需要
.safetensors 转为 GGUF(FLUX)使用 llama.cpp 或 flux-gguf 工具:
python convert-flux-to-gguf.py \
--input flux.safetensors \
--output flux-Q4_K_M.gguf \
--quant Q4_K_M| 显卡 | 推荐方案 |
|---|---|
| RTX 4090 / 3090 | FP16 / FP8 |
| RTX 3060 12G | FP8 / Q4 GGUF |
| RTX 2060 / 6G | GGUF Q4 |
| 纯 CPU | GGUF Q4 |
❌ “ComfyUI 模型一定要量化”
✅ 不是必须,FP16 质量最好
❌ “量化一定掉质量”
✅ FP8 / Q5 几乎看不出差异
❌ “LoRA 也要量化”
你可以直接告诉我:
我可以给你最优量化参数 + ComfyUI 节点配置。