Linux怎么安装llama3

AI技术
小华
2026-07-28

在 Linux 上安装 LLaMA 3(Meta Llama 3) 通常有两种主流方式:
使用 Ollama(最简单,推荐)
使用 Python + Hugging Face(更灵活)

下面我按 从简单到进阶 给你讲清楚。

✅ 方式一:用 Ollama 安装 LLaMA 3(强烈推荐)

1️⃣ 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

安装完成后验证:

ollama --version

2️⃣ 拉取并运行 LLaMA 3

ollama run llama3

✅ 默认是 8B 模型

✅ 会自动下载并启动对话

3️⃣ 可选:指定模型大小

ollama run llama3:8b
ollama run llama3:70b   # 需要大显存

4️⃣ 常用命令

ollama list          # 查看已安装模型
ollama rm llama3     # 删除模型

✅ 优点

  • 一行命令就能跑
  • 自动管理 GPU / CPU
  • 支持本地 API(可接 Web / 程序)

✅ 方式二:用 Python + Hugging Face(进阶)

适合:

  • 想做微调
  • 想用 LangChain
  • 想控制推理参数

1️⃣ 安装依赖

pip install torch transformers accelerate

如果你有 NVIDIA GPU(推荐):

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

2️⃣ 登录 Hugging Face

huggingface-cli login

⚠️ 需要:


3️⃣ 运行 LLaMA 3(示例)

from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "介绍一下 Linux"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

✅ 硬件要求(参考)

模型最低显存
LLaMA 3 8B8GB(推理)
LLaMA 3 70B40GB+

没有 GPU 也能跑,但会 很慢

✅ 常见问题

❓ 需要申请吗?

  • Ollama:不需要
  • Hugging Face:需要申请 Meta 授权

❓ 能离线用吗?

✅ 可以,模型下载后完全本地运行

❓ 能接 Web 界面吗?

✅ 可以,Ollama 自带 API,可接:

  • Open WebUI
  • Chatbox
  • Lobe Chat

✅ 推荐方案总结

需求推荐
普通使用✅ Ollama
开发 / 微调✅ Python + HF
无 GPU✅ Ollama CPU

如果你愿意,我可以帮你:

  • 适合你显卡的模型
  • Web 聊天界面
  • 中文优化 / 微调方案

你现在的 Linux 是 Ubuntu / CentOS / Arch?有没有 GPU?

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序