Linux怎么部署llama3模型

AI技术
小华
2026-07-27

Linux 上部署 Llama 3,目前最主流、最简单的方式是 使用 Ollama。下面我按「推荐方案 → 进阶方案」给你完整说明。

✅ 一、最推荐方案:使用 Ollama(最简单)

1️⃣ 安装 Ollama(支持 Ubuntu / Debian / CentOS / Arch)

curl -fsSL https://ollama.com/install.sh | sh

安装完成后验证:

ollama --version

2️⃣ 下载并运行 Llama 3

运行 8B 模型(默认)

ollama run llama3

运行 70B 模型(需要大显存)

ollama run llama3:70b
首次运行会自动下载模型(约 4.7GB / 39GB)

3️⃣ 使用方式

命令行交互

ollama run llama3

Python 调用

import ollama
response = ollama.chat(
model="llama3",
messages=[
{"role": "user", "content": "用中文介绍一下LLaMA 3"}
]
)
print(response["message"]["content"])

4️⃣ 模型保存目录

~/.ollama/models

✅ 二、使用官方 Llama 3(Meta 原版)

1️⃣ 申请模型访问权限


2️⃣ 登录 Hugging Face

pip install huggingface_hub
huggingface-cli login

3️⃣ 安装依赖

pip install transformers accelerate torch

4️⃣ 推理代码(示例)

from transformers import AutoTokenizer, AutoModelForCausalLM
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "用中文介绍一下LLaMA 3"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

✅ 推荐 至少 16GB 显存(8B)

✅ 70B 建议 A100 / H100

✅ 三、GPU / CPU 说明

模型推荐配置
Llama 3 8BRTX 3060 16G / 3090
Llama 3 70BA100 / H100
CPU 运行可,但很慢

CPU 运行:

OLLAMA_CPU_ONLY=1 ollama run llama3

✅ 四、常见问题

Q1:Ollama 能商用吗?

✅ 可以(Llama 3 社区许可)

Q2:离线部署?

✅ 下载后完全本地运行

Q3:中文支持好吗?

✅ 不错,但建议用 llama3:8b-instruct

✅ 五、我可以进一步帮你

你可以告诉我:

  1. ✅ 是否有 GPU?型号?
  2. ✅ 是否要部署 API?
  3. ✅ 是否要离线 / 内网部署?
  4. ✅ 是否要和 Python / Java / Web 集成?

我可以给你 最合适的部署方案 + 完整代码

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序