llama.cpp(INT4 量化)| 量化方式 | 显存需求 | 备注 |
|---|---|---|
| FP16 | ~16 GB | 原生精度 |
| INT8 | ~10 GB | 稳定 |
| Q4_K_M | ~6–7 GB | 最常用 |
| Q2_K | ~4.5 GB | 精度略降 |
✅ 推荐显卡
| 配置 | 显存 |
|---|---|
| 2 × 24GB | ✅ 可行 |
| 2 × 3090 / 4090 | ✅ 推荐 |
| 1 × 80GB A100 | ✅ 完美 |
模型大小 ≈ 参数量 × 每个参数字节数| 精度 | 每个参数 |
|---|---|
| FP16 | 2 字节 |
| INT8 | 1 字节 |
| Q4 | 0.5 字节 |
示例:Llama 3 8B Q4
8B × 0.5B ≈ 4–6 GB✅ 普通开发 / 本地测试
✅ 生产 / 高频调用
✅ 70B
Llama 3 8B:16GB 内存起步,6GB 显存可跑;70B:64GB 内存起步,必须多卡 GPU。
如果你愿意,可以告诉我:
我可以帮你给出最省资源的部署方案。