llama3如何装到Linux上

AI技术
小华
2026-08-26

在 Linux 上部署 LLaMA 3(Meta 的 Llama 3) 通常有两种主流方式:
1️⃣ 直接用 Ollama(最简单,推荐)
2️⃣ 用 Hugging Face + transformers(更灵活,适合开发)

下面我按 从简单到专业 给你讲清楚。

✅ 方式一:用 Ollama 安装 LLaMA 3(最简单,强烈推荐)

1️⃣ 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

安装完成后验证:

ollama --version

2️⃣ 拉取并运行 LLaMA 3

ollama run llama3

默认是 8B 模型,会自动下载并运行。
如果你想指定版本:

ollama run llama3:8b
ollama run llama3:70b   # 需要大显存

3️⃣ 使用方式

在终端直接对话:

ollama run llama3

或作为 API 服务:

ollama serve

API 默认地址:

http://localhost:11434

✅ 方式二:用 Hugging Face + Python(适合开发)

1️⃣ 创建 Python 环境

conda create -n llama3 python=3.10
conda activate llama3

2️⃣ 安装依赖

pip install torch transformers accelerate

(如果你有 NVIDIA GPU,建议装 CUDA 版 PyTorch)

3️⃣ 登录 Hugging Face

huggingface-cli login

⚠️ LLaMA 3 需要申请访问权限


4️⃣ 运行 LLaMA 3(示例)

from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "你好,介绍一下你自己"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

✅ 硬件要求(非常重要)

模型最低显存
LLaMA 3 8B8GB 以上
LLaMA 3 70B40GB+(A100)

没有 GPU?

✅ 用 Ollama + CPU 也能跑(速度慢)

✅ 对比总结

方式适合人群难度
Ollama普通用户 / 快速用
Hugging Face开发者 / 研究⭐⭐⭐

✅ 常见问题

❓ 需要联网吗?

  • 下载模型需要
  • 跑模型不需要

❓ 能商用吗?

  • LLaMA 3 有 社区许可协议
  • 商用前建议看 Meta 官方许可

❓ 支持中文吗?

  • 原生支持一般
  • 可配合 中文 prompt / 微调

如果你愿意,我可以:
✅ 帮你选 合适模型大小
✅ 给你 GPU 配置建议
✅ 教你 本地 API 调用 / 接入前端
你现在用的是 Ubuntu / CentOS / 其他 Linux?有没有 GPU?

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序