通过量化压缩模型,可运行更大参数量的模型:
| 量化精度 | 单参数占用 | 16GB显存可加载模型大小 | 代表模型示例 |
|---|---|---|---|
| FP16 | 2字节 | ~8B | Llama 3 8B, Mistral 7B |
| INT8 | 1字节 | ~14B | Llama 2 13B, Yi 1.5 9B |
| INT4 | 0.5字节 | ~30B | Llama 3 30B, Qwen2 32B |
| INT3/2 | 更低 | ~70B(极限) | Llama 3 70B(需优化) |
实际推荐:
offload将部分层放到内存(速度降低,但可运行超大模型)。| 场景 | 推荐模型 | 量化/配置 | 预期表现 |
|---|---|---|---|
| 日常对话/代码 | Llama 3 8B, Qwen2 7B | FP16/INT8 | 速度快(30+ token/s),显存占用<12GB |
| 专业任务(写作/分析) | Qwen2 14B, Yi 1.5 34B | INT4 | 质量高,速度约15-20 token/s |
| 极限尝鲜 | Llama 3 70B | Q4_K_M + 内存卸载 | 速度慢(5-8 token/s),需64GB+内存 |
建议优先尝试 Qwen2.5 14B/32B INT4 或 Llama 3 8B/70B Q4_K_M,根据任务需求调整量化等级。若需运行70B+模型,建议升级至24GB显存(如RTX 4090)或使用云服务。