客户端 / Web UI
↓
API 网关(负载均衡)
↓
SD 推理节点(GPU)
↓
模型存储 / 缓存| 组件 | 作用 |
|---|---|
| GPU 节点 | 运行 SD 推理(A10 / A100 / 4090 等) |
| API 服务 | 提供 txt2img / img2img 接口 |
| 负载均衡 | 分发请求 |
| 模型仓库 | 管理 ckpt / lora / vae |
| 任务队列 | 异步生图(Celery / Redis) |
| 监控系统 | GPU 利用率、队列长度 |
python launch.py \
--api \
--listen \
--port 7860 \
--gpu \
--ckpt /models/model.ckptnode1: 192.168.1.10:7860
node2: 192.168.1.11:7860
node3: 192.168.1.12:7860upstream sd_cluster {
server 192.168.1.10:7860;
server 192.168.1.11:7860;
server 192.168.1.12:7860;
}
server {
listen 80;
location / {
proxy_pass http://sd_cluster;
}
}Ingress
↓
FastAPI
↓
Triton Inference Server
↓
GPU Pool@app.task
def generate_image(prompt):
return sd_api.txt2img(prompt)用户请求 → 队列 → Worker → GPU → 返回/models| 规模 | GPU |
|---|---|
| 测试 | 1×3090 |
| 小规模 | 2×4090 |
| 中规模 | A10 ×4 |
| 企业 | A100 ×8 |
❌ 每个请求都加载模型(慢)
✅ 常驻进程 + 模型缓存
❌ 无队列(GPU 被打满)
✅ 限流 + 异步
❌ 单点故障
✅ 写一份 Docker + Nginx + SD API 集群部署脚本
✅ 给你一套 K8s YAML 示例
✅ 设计 私有 SD 云服务平台
✅ 根据你的并发量做架构选型
你可以告诉我: