Llama 3 模型的推理速度并不是一个固定值,它取决于多个因素,包括模型参数规模、硬件配置、推理框架优化、batch size、序列长度等。下面按常见情况给你一个大致参考:
以 单卡 GPU、FP16 精度、基础优化(如 HuggingFace + vLLM / TensorRT-LLM) 为例:
| 模型规模 | 典型硬件 | 推理速度(tokens / 秒) |
|---|---|---|
| Llama 3 8B | 单张 RTX 4090 | 约 30–80 tokens/s |
| Llama 3 8B | A100 80G | 约 100–200 tokens/s |
| Llama 3 70B | 单张 A100 80G | 约 10–25 tokens/s |
| Llama 3 70B | 2–4× A100 | 约 40–100 tokens/s |
| Llama 3 405B | 多卡 H100 集群 | 约 20–50 tokens/s |
注:tokens/s 指生成速度(decode),不包括首 token 延迟(prefill)。
如果你有具体硬件 + 模型版本 + 使用场景,我可以给更精确的速度估算或优化建议。