在 Linux 上安装 LLaMA 3(Meta Llama 3) 通常有两种主流方式:
✅ Ollama(最简单,推荐新手)
✅ 本地手动部署(llama.cpp / Python)
curl -fsSL https://ollama.com/install.sh | sh安装完成后验证:
ollama --versionollama run llama3默认会下载:
ollama run llama3:8b
ollama run llama3:70b # 需要大显存ollama list # 查看已安装模型
ollama rm llama3 # 删除模型适合:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make你需要从 Meta 官网 或 Hugging Face 获取:
https://huggingface.co/meta-llama/Meta-Llama-3-8B-Instruct
⚠️ 需要登录并申请访问权限
下载后例如:
Meta-Llama-3-8B-Instruct/
├── model-00001-of-00002.safetensors
├── tokenizer.modelpython convert-hf-to-gguf.py Meta-Llama-3-8B-Instruct./llama-cli \
-m llama3-8b.Q4_K_M.gguf \
-p "你好,LLaMA 3" \
-n 256适合:
pip install transformers accelerate torchfrom transformers import AutoTokenizer, AutoModelForCausalLM
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "介绍一下 Linux"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))⚠️ 需要:
| 模型 | 最低显存 | 推荐 |
|---|---|---|
| LLaMA 3 8B | 8GB | 16GB |
| LLaMA 3 70B | 40GB+ | A100 |
✅ 可以,Ollama + CPU 也能跑(速度慢)
| 场景 | 推荐 |
|---|---|
| 新手 / 快速体验 | ✅ Ollama |
| 本地部署 / 服务 | llama.cpp |
| 开发 / 微调 | transformers |
如果你愿意,我可以:
你现在用的是 Ubuntu / CentOS / Arch?有没有 GPU?