怎样在Linux跑llama3

AI技术
小华
2026-09-25

在 Linux 上运行 Llama 3(Meta 的 Llama 3 模型),常见、简单、稳定的方式有三种:Ollama(最推荐)、llama.cpp(轻量高效)、Hugging Face + transformers(偏开发)。下面按推荐程度给你讲。

一、最简单方式:用 Ollama(强烈推荐)

1. 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

安装完成后:

ollama --version

2. 拉取并运行 Llama 3

ollama run llama3

默认是 8B 模型,会自动下载。
如果你想指定版本:

ollama run llama3:8b
ollama run llama3:70b   # 需要大显存

3. 使用方式

  • 直接在终端对话
  • 或作为本地 API:
ollama serve

访问:

http://localhost:11434

二、高性能方式:llama.cpp(CPU / GPU 都能跑)

适合:

  • 低显存
  • 量化模型
  • 自己部署服务

1. 安装依赖

sudo apt update
sudo apt install -y build-essential cmake git

2. 克隆并编译

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

3. 下载 Llama 3 模型(GGUF 格式)

推荐从 Hugging Face 下载:

  • TheBloke/Llama-3-8B-GGUF

例如:

wget https://huggingface.co/TheBloke/Llama-3-8B-GGUF/resolve/main/llama-3-8b.Q4_K_M.gguf

4. 运行

./main -m llama-3-8b.Q4_K_M.gguf -p "你好"

GPU 加速(如 CUDA):

make clean && make LLAMA_CUDA=1

三、开发方式:Hugging Face transformers

适合:

  • 做二次开发
  • 微调
  • Python 项目

1. 安装环境

pip install torch transformers accelerate

2. 示例代码

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-8B"
)
tokenizer = AutoTokenizer.from_pretrained(
"meta-llama/Meta-Llama-3-8B"
)
inputs = tokenizer("你好", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0]))

⚠️ 注意:

  • 需要从 Meta 官网申请 Llama 3 使用权
  • 或使用社区镜像

四、硬件建议

模型最低显存
Llama 3 8B(Q4)6–8 GB
Llama 3 8B(FP16)16 GB
Llama 3 70B40 GB+

五、常见问题

Q:没有 GPU 能跑吗?

✅ 可以,Ollama 和 llama.cpp 都支持 CPU(速度较慢)

Q:模型从哪下载?

  • Ollama:自动
  • Hugging Face / TheBloke

Q:能不能网页界面?

可以加:

  • Open WebUI
  • LobeChat

如果你告诉我:

  • 是否有 GPU
  • 显存大小
  • 是否要中文优化
  • 是否要 API 服务

我可以直接给你一套最适合你的部署方案。

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序