提升 DeepSeek-R1(或任何大模型)推理吞吐量(Throughput),核心目标是在相同硬件下服务更多请求 / 生成更多 token / 降低单位成本。下面从模型、系统、工程、部署四个层面系统说明。
一、模型层优化(最根本)
1. 使用量化(强烈推荐)
- INT8 / FP8(Hopper 最佳)
- INT4 / GPTQ / AWQ(边缘或低成本)
优点:
示例:
# vLLM + AWQ
python -m vllm.entrypoints.api_server \
--model deepseek-ai/deepseek-r1 \
--quantization awq
2. 使用 MoE 特性(DeepSeek-R1 是 MoE)
DeepSeek-R1 是 稀疏 MoE:
✅ 保证质量的同时:
优化点:
- 专家并行(Expert Parallel)
- 专家负载均衡调度
3. 蒸馏 / 小模型替代
若任务允许:
- DeepSeek-R1-Distill(7B / 14B / 32B)
- 吞吐可提升 5–10 倍
二、推理框架层(最关键杠杆)
✅ 首选:vLLM / TensorRT-LLM / SGLang
vLLM(最易用)
核心能力:
- PagedAttention
- 连续 batching
- 高 GPU 利用率
示例:
vllm serve deepseek-ai/deepseek-r1 \
--tensor-parallel-size 8 \
--max-num-seqs 256
关键参数(吞吐调优)
| 参数 | 建议 |
|---|
| max-num-seqs | 128–512 |
| max-model-len | 尽量小(如 8k) |
| gpu-memory-utilization | 0.9–0.95 |
| enable-prefix-caching | ✅ |
三、批处理与调度优化
1. 连续批处理(Continuous Batching)
❌ 传统:一个 batch 全完成才下一个
✅ vLLM / TRT:token 级调度
→ GPU 空转 ↓
→ 吞吐 ↑ 2–4x
2. 请求合并(Prefix Cache)
适用于:
--enable-prefix-caching
四、硬件与并行策略
1. 张量并行(TP)
2. 流水线并行(PP)
3. 专家并行(EP)
- DeepSeek MoE 专用
- 专家分布到不同 GPU
五、输入输出优化
1. 控制最大生成长度
--max-tokens 512
越长:
2. 输入裁剪
六、服务架构优化
1. 异步 + 队列
2. 多实例负载均衡
- Kubernetes + 多 vLLM
- 按 GPU 利用率路由
七、典型吞吐提升路径(实战)
| 阶段 | 吞吐 |
|---|
| 原生 HF | 1× |
| vLLM | 3–5× |
| vLLM + INT8 | 5–8× |
| vLLM + TP8 + batch | 10×+ |
八、如果你告诉我:
- GPU 型号 / 数量
- 模型版本(R1 / Distill)
- 延迟要求
- 应用场景(对话 / 代码 / 批处理)
我可以直接给你一套可落地的部署配置。