在 ComfyUI 中“调优模型批处理量(batch size / 并发数)”通常可以从显存、节点设置、队列与后端、模型加载方式几个层面来做。下面按实用优先级给你一套思路。
一、先明确你说的“批处理量”是哪一类
ComfyUI 里常见的“批”有几种:
- 单图一次生成多张(batch_size)
- 一次提交多个 Prompt / 多张图(队列并发)
- 多模型轮流推理(模型切换批处理)
- 视频 / 多帧批量处理
不同场景调优方式不一样。
二、最直接:调 Batch Size(生成多张)
在 ComfyUI 原生节点中:
KSampler / KSampler (Advanced)batch_size 参数- 或使用
PrimitiveNode → batch_size
调优建议
- 显存占用 ≈ 单张 × batch_size
- 经验值(SD1.5 / 2G 模型):
- 8G 显存:batch ≤ 2–4
- 12G:batch ≤ 4–8
- 24G:batch ≤ 8–16
- 如果 OOM:
- 降低
batch_size - 降低
height/width - 使用
--medvram / --lowvram
三、队列并发(一次跑多个任务)
ComfyUI 默认是串行队列。
提高吞吐的方法
1. 启动参数(重要)
python main.py --cuda-device 0 --listen
或使用:
--gpu-only
--highvram
2. 使用 API + 并发客户端
- 写 Python 脚本用
/prompt 接口并发提交 - 注意:
- 同一 GPU 并发 ≠ 更快
- 一般 2–4 并发收益最大
3. 多 GPU
--cuda-device 0
不同进程绑不同卡,用 Nginx / 队列调度
四、显存与速度调优(核心)
启动参数推荐
--highvram # 大显存
--medvram # 中等
--lowvram # 小卡
--disable-smart-memory
模型加载优化
- 使用
ModelPass / UnetLoader 明确释放 - 避免重复加载同模型
- 使用
GGUF / safetensors 更快
五、ComfyUI-Manager / 插件辅助
推荐插件:
- ComfyUI-Manager
- ComfyUI-Batch
- ComfyUI-VideoHelperSuite(视频批处理)
- ComfyUI-Queue-Batch
这些可以:
六、典型调优模板(示例)
24G 显卡,SDXL
python main.py --highvram --cuda-device 0
- batch_size = 4
- 分辨率 1024×1024
- 队列并发 = 2
12G 显卡,SD1.5
python main.py --medvram
- batch_size = 2
- 分辨率 512×768
七、常见坑
- ❌ batch 太大 → OOM 或掉速
- ❌ 队列并发高但显存小 → 更慢
- ❌ 每次都 reload 模型 → 极慢
- ✅ 固定模型 + 批量 prompt 最优
如果你愿意,可以告诉我:
- 显卡型号
- 模型类型(SD1.5 / SDXL / Flux)
- 是“一次多张”还是“多任务并发”
我可以直接给你具体参数配置。