下面以 Meta 官方的 Llama 3(llama3)在 Linux 上安装 为例,给你一套最常用、最稳妥的做法。
sudo apt update
sudo apt install -y git wget curl build-essentialcurl -fsSL https://ollama.com/install.sh | sh安装完成后检查:
ollama --versionollama run llama3默认是 llama3:8b
如果你想用 70B:
ollama run llama3:70bollama list # 查看已安装模型
ollama rm llama3 # 删除模型⚠️ 需要 Meta 授权 + HuggingFace 账号
pip install huggingface_hub
huggingface-cli loginhuggingface-cli download meta-llama/Meta-Llama-3-8B-Instruct \
--local-dir llama3-8b适合:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make下载 GGUF 模型(例如从 HuggingFace):
./main -m llama3-8b-q4_0.gguf -p "你好"pip install transformers acceleratefrom transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct",
device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct"
)你可以直接告诉我:
1️⃣ 有没有 NVIDIA 显卡?
2️⃣ 想跑 8B 还是 70B?
3️⃣ 是 聊天 / 编程 / 本地部署 / 服务器?
我可以直接给你 一条最适合你的命令方案 ✅