适合:个人、开发、测试、本地使用
优点
安装示例(Ubuntu / Debian / CentOS 等通用)
curl -fsSL https://ollama.com/install.sh | sh运行 LLaMA 3
ollama run llama3默认是 llama3:8b,你也可以指定:ollama run llama3:70b适合:研究、嵌入式、推理加速、量化部署
特点
简要流程
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make然后运行模型:
./main -m llama3-8b-q4.gguf -p "你好"适合:开发、微调、接口服务
环境
pip install transformers accelerate示例代码
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct",
device_map="auto",
torch_dtype="auto"
)
tokenizer = AutoTokenizer.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct"
)⚠️ 注意:
| 模型 | CPU | GPU(推荐) |
|---|---|---|
| LLaMA 3 8B | 16核+ | 16GB+ 显存 |
| LLaMA 3 70B | 32核+ | 2×A100 / A6000 |
使用 量化模型(如 Q4) 可大幅降低资源需求。
✅ Ubuntu / Debian
✅ CentOS / Rocky / Alma
✅ Arch Linux
LLaMA 3 非常适合在 Linux 上部署,推荐优先使用 Ollama 或 llama.cpp。
如果你愿意,我可以根据你的:
给你一套最合适的部署方案。