RTX 3070 的硬件规格大致是:
- 显存:8GB GDDR6
- 显存带宽:约 448 GB/s
- 算力:约 20–30 TFLOPS(FP16 视是否支持 TF32/稀疏而定)
能跑多大的模型(核心看显存)
模型参数大小 ≈ 参数量 × 每参数字节数
常见精度占用:
- FP32:4 bytes/参数
- FP16 / BF16:2 bytes/参数
- INT8:1 byte/参数
- 4-bit 量化:0.5 byte/参数
粗略上限(仅模型权重,不含上下文/激活)
| 精度 | 可加载参数量(约) |
|---|
| FP16 | 4B 参数 |
| INT8 | 8B 参数 |
| 4-bit | 13–14B 参数 |
⚠️ 实际还要留 1–2GB 显存给 CUDA、上下文、KV Cache、激活值。
实际可用建议
比较舒服的情况
- 7B 模型(如 LLaMA-2/3 7B、Qwen2.5-7B)
- FP16:刚好能跑(约 14GB?不对,7B×2=14GB ❌)
- 实际 7B FP16 ≈ 13–14GB,3070 8G 跑不了纯 FP16
- ✅ 用 4-bit / 5-bit 量化(GPTQ / AWQ / GGUF Q4) 可以流畅跑
能跑的模型规模
- ✅ 3B–7B:4-bit 量化,体验很好
- ⚠️ 13B:4-bit 量化可跑,但上下文不能太长(如 2k–4k)
- ❌ 30B+:基本不现实(即使量化也超显存)
推荐方案(RTX 3070 8G)
- 本地推理
- llama.cpp + GGUF(Q4_K_M)
- Ollama(自动量化)
- 模型示例:
- Qwen2.5-7B-Instruct Q4
- LLaMA-3-8B Q4
- Phi-3-mini(3.8B,很适合)
- 微调
- 7B 模型:只能做 LoRA / QLoRA(4-bit + 低秩)
- 全参微调:不现实
一句话总结
RTX 3070 8G 能跑 7B 级别 4-bit 量化模型比较舒服,13B 勉强,30B 以上基本不行。
如果你说具体用途(推理 / 微调 / 图像 / 训练),我可以给更精确的配置建议。