在Linux上部署 Llama 3(8B / 70B) 的配置,主要取决于 模型规模、推理方式(量化/非量化)、是否多用户并发。下面按最常见场景给你一套实用配置建议。
一、Llama 3 模型版本说明
| 模型 | 参数量 | 推荐显存(FP16) | 量化后可接受显存 |
|---|
| Llama 3 8B | 8B | ~16GB | 8GB(4bit) |
| Llama 3 70B | 70B | ~140GB | 24–48GB(4bit) |
二、最低可用配置(个人/测试)
✅ Llama 3 8B(4bit 量化)
适合:个人学习、本地测试
硬件
- GPU:NVIDIA RTX 3060 12GB / 4060 / A10
- CPU:4 核以上
- 内存:16GB+
- 磁盘:30GB(模型 + 环境)
软件
Ubuntu 20.04 / 22.04
CUDA 12.x
Python 3.10
部署方式
- Ollama(最推荐,简单)
- llama.cpp(CPU / GPU 混合)
三、推荐生产配置(单用户 / 小团队)
✅ Llama 3 8B(FP16 或 GGUF Q5/Q6)
适合:API 服务、内部工具
硬件
- GPU:RTX 4090 / A100 40GB / A6000
- CPU:8–16 核
- 内存:32–64GB
- 磁盘:100GB SSD
推理框架
- vLLM(高吞吐)
- TGI(HuggingFace Text Generation Inference)
四、70B 模型配置(企业级)
✅ Llama 3 70B(4bit 量化)
适合:企业部署、多并发
硬件
- GPU:
- 2 × A100 40GB
- 或 1 × A100 80GB
- CPU:16 核+
- 内存:128GB+
- 磁盘:200GB+
部署方式
- vLLM + tensor parallel
- Ray + vLLM
- HuggingFace TGI
五、纯 CPU 部署(不推荐但可行)
✅ Llama 3 8B(GGUF Q4)
- CPU:16 核以上(AMD / Intel)
- 内存:32GB+
- 推理速度:慢(1–3 token/s)
工具:
llama.cpp
六、推荐部署方案对比
| 方案 | 易用性 | 性能 | 适合人群 |
|---|
| Ollama | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | 初学者 |
| llama.cpp | ⭐⭐⭐ | ⭐⭐⭐⭐ | 本地/CPU |
| vLLM | ⭐⭐ | ⭐⭐⭐⭐⭐ | 生产环境 |
| TGI | ⭐⭐⭐ | ⭐⭐⭐⭐ | 企业 |
七、我给你一个「最省心」方案(推荐)
Llama 3 8B + Ollama + Ubuntu 22.04
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3
✅ 10 分钟跑起来
✅ 支持 API
✅ 支持 Docker
八、如果你愿意告诉我:
我可以帮你精准配置,直接给你一套命令级部署方案
请告诉我:
- 用 8B 还是 70B?
- 有 GPU 吗?型号?
- 是本地用、API 服务,还是生产环境?
- 是否需要中文优化?
我可以直接给你:
✅ 硬件清单
✅ 软件版本
✅ 完整部署命令
✅ 性能调优参数