怎样在Linux装llama3

AI技术
小华
2026-07-28

在 Linux 上部署 LLaMA 3(Meta 的 Llama 3) 常见有三种方式,从最简单最灵活依次如下。你可以按自己的需求选择。

一、最推荐:用 Ollama(最简单,适合大多数人 ✅)

1️⃣ 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

安装完成后验证:

ollama --version

2️⃣ 下载并运行 LLaMA 3

LLaMA 3 8B(推荐,显存 ≥ 8GB)

ollama run llama3

LLaMA 3 70B(显存 ≥ 40GB,或 CPU 很慢)

ollama run llama3:70b

运行后你就可以直接在终端对话了 ✅

3️⃣ 常用命令

ollama list          # 查看已下载模型
ollama rm llama3     # 删除模型
ollama serve         # 启动 API 服务

二、用 Python + Hugging Face(适合开发者)

1️⃣ 安装依赖

pip install transformers accelerate torch

2️⃣ 下载并运行 LLaMA 3

from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "你好,介绍一下你自己"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

⚠️ 注意:

  • 需要 Hugging Face 账号 + 申请 LLaMA 3 访问权限
  • 显存建议 ≥ 8GB(8B 模型)

三、用 llama.cpp(CPU / 低显存,最轻量)

适合:

  • 没有 GPU
  • 想在老机器或服务器跑

1️⃣ 编译 llama.cpp

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

2️⃣ 下载 GGUF 模型

从 Hugging Face 下载,例如:

wget https://huggingface.co/Meta-Llama/Meta-Llama-3-8B-Instruct-GGUF/resolve/main/llama3-8b-instruct-q4_0.gguf

3️⃣ 运行

./main -m llama3-8b-instruct-q4_0.gguf -p "你好" -n 200

四、硬件要求参考

模型显存CPU推荐方式
LLaMA 3 8B≥ 8GB16GB+Ollama
LLaMA 3 70B≥ 40GB64GB+Ollama / llama.cpp
CPU 跑32GB+llama.cpp

五、我可以进一步帮你

你可以告诉我:

  • ✅ 是否有 GPU / 显存多大
  • ✅ 是否要 API / 本地对话 / 嵌入模型
  • ✅ 是否用于 中文 / 编程 / 生产环境

我可以直接给你最优方案 + 具体命令

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序