✅ 首选方案,效果最明显
| 精度 | 显存占用(70B) | 说明 |
|---|---|---|
| FP16 | ~140GB | 基线 |
| INT8 | ~70GB | 几乎无损 |
| INT4 | ~35GB | 可接受损失 |
| GGUF Q4 | 单卡 24GB 可跑 70B | 本地部署常用 |
推荐工具
# 示例:4bit 加载
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-70B",
load_in_4bit=True
)✅ 微调必用,否则显存爆炸
# QLoRA 示例
--load_in_4bit
--use_lora
--lora_r 64
--lora_alpha 16显存对比
| 方式 | 70B 显存 |
|---|---|
| 全参数微调 | >300GB |
| LoRA | ~80GB |
| QLoRA (4bit) | ~24GB |
✅ 长上下文必做
pip install vllm✅ 多卡 / 大内存机器
# DeepSpeed
--tensor-parallel-size 4| 框架 | 显存占用 | 适用 |
|---|---|---|
| llama.cpp | ⭐最低 | 本地/CPU |
| vLLM | ⭐⭐ | 高并发 |
| Transformers | ⭐⭐⭐ | 灵活 |
| DeepSpeed | ⭐⭐⭐⭐ | 训练 |
✅ 不是必须就别全参数训练
| 场景 | 推荐方案 |
|---|---|
| 本地跑 70B | llama.cpp + GGUF Q4 |
| 单卡推理 | GPTQ / AWQ 4bit |
| 单卡微调 | QLoRA |
| 多卡推理 | vLLM + TP |
| 长文本 | PagedAttention + 短 max_len |
量化 + LoRA + vLLM / llama.cpp = 显存成本最低组合
如果你愿意,可以告诉我:
我可以直接给你一套可复制的最优配置方案。