如何选Linux装llama3

AI技术
小华
2026-09-25

在 Linux 上运行 Llama 3,一般有两种主流方式:

一、先确认硬件条件

1. 显存(GPU 用户)

Llama 3 常见版本:

  • 8B(80 亿参数)
  • Q4(4-bit 量化):约 6 GB 显存
  • FP16:约 16 GB 显存
  • 70B
  • Q4:约 40 GB+ 显存
  • 一般需要多卡

2. CPU 也能跑(慢)

  • 8B Q4 在 16GB 内存的机器上可跑(速度慢)

二、Linux 发行版选择(不重要,但推荐)

✅ 推荐:

  • Ubuntu 22.04 / 24.04
  • Debian 12
  • Rocky / AlmaLinux(服务器)

❌ 不推荐:

  • 太老的系统(glibc 过低)

三、最推荐方案:Ollama(最简单)

1. 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

2. 拉取并运行 Llama 3

ollama run llama3

可选版本:

ollama run llama3:8b
ollama run llama3:70b

✅ 优点:

  • 自动量化
  • 支持 GPU / CPU
  • 一行命令

四、进阶方案:llama.cpp(性能好)

适合:

  • 自己控制量化
  • 低资源设备

1. 安装依赖

sudo apt install git build-essential cmake

2. 编译

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

3. 下载模型(需 HuggingFace 权限)

huggingface-cli download meta-llama/Meta-Llama-3-8B-Instruct

4. 运行

./main -m model.gguf -p "你好"

五、GPU 加速(重要)

NVIDIA

nvidia-smi

安装 CUDA:

sudo apt install nvidia-cuda-toolkit

Ollama 会自动使用 GPU

六、快速选择建议

场景推荐
新手Ollama
低显存llama.cpp + Q4
服务器Ollama + API
研究HuggingFace Transformers

如果你愿意,可以告诉我:

  • CPU / GPU 型号
  • 内存 / 显存大小
  • 是否要中文对话

我可以直接给你最合适的命令。

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序