Llama 3 模型的显存占用取决于模型参数规模、量化方式、上下文长度(序列长度)、批大小(batch size)以及是否启用微调/推理优化等因素。以下是常见配置的参考值:
1. 模型参数规模与基础显存(FP16/ BF16 精度,纯推理)
- Llama 3 8B
- FP16/BF16:约 16 GB(权重 8B×2Byte)
- 4-bit 量化(如 Q4_K_M):约 5–6 GB
- 8-bit 量化:约 8–9 GB
- Llama 3 70B
- FP16/BF16:约 140 GB(需多卡,如 2×80GB A100 / H100)
- 4-bit 量化:约 35–40 GB(单张 48GB 显卡如 A6000 可跑)
- 8-bit 量化:约 70 GB
2. 推理时的额外显存
除权重外,还需考虑:
- KV Cache:随上下文长度和 batch 增大而显著增加(例如 8B 模型、4k 上下文、batch=1 约额外 1–2 GB)
- 激活值、框架开销:通常几 GB
3. 微调(训练)显存
- 全参数微调 8B(BF16 + 单卡):需 60–80 GB+
- LoRA / QLoRA 微调 8B(4-bit 基座):12–24 GB 即可(如 24GB 的 3090/4090)
4. 常见硬件适配示例
- 本地跑 Llama 3 8B 推理:RTX 3060 12GB(4-bit)、4070 Ti 16GB(8-bit)
- 70B 推理:双卡 24GB(4-bit 拆分)或单卡 48GB+
如果你有具体用途(推理/微调)、量化和显卡型号,我可以给更精确的数字。