在 Linux 上部署 LLaMA 3(Meta 的 Llama 3) 通常有两种主流方式:
1️⃣ 直接用 Ollama(最简单,推荐)
2️⃣ 用 Hugging Face + transformers(更灵活,适合开发)
curl -fsSL https://ollama.com/install.sh | sh安装完成后验证:
ollama --versionollama run llama3默认是 8B 模型,会自动下载并运行。
如果你想指定版本:
ollama run llama3:8b
ollama run llama3:70b # 需要大显存在终端直接对话:
ollama run llama3或作为 API 服务:
ollama serveAPI 默认地址:
http://localhost:11434conda create -n llama3 python=3.10
conda activate llama3pip install torch transformers acceleratehuggingface-cli login⚠️ LLaMA 3 需要申请访问权限
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "你好,介绍一下你自己"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))| 模型 | 最低显存 |
|---|---|
| LLaMA 3 8B | 8GB 以上 |
| LLaMA 3 70B | 40GB+(A100) |
没有 GPU?
| 方式 | 适合人群 | 难度 |
|---|---|---|
| Ollama | 普通用户 / 快速用 | ⭐ |
| Hugging Face | 开发者 / 研究 | ⭐⭐⭐ |
如果你愿意,我可以:
✅ 帮你选 合适模型大小
✅ 给你 GPU 配置建议
✅ 教你 本地 API 调用 / 接入前端
你现在用的是 Ubuntu / CentOS / 其他 Linux?有没有 GPU?