curl -fsSL https://ollama.com/install.sh | sh安装完成后:
ollama --versionollama run llama3默认是 8B 模型,会自动下载。
如果你想指定版本:
ollama run llama3:8b
ollama run llama3:70b # 需要大显存ollama serve访问:
http://localhost:11434适合:
sudo apt update
sudo apt install -y build-essential cmake gitgit clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make推荐从 Hugging Face 下载:
TheBloke/Llama-3-8B-GGUF例如:
wget https://huggingface.co/TheBloke/Llama-3-8B-GGUF/resolve/main/llama-3-8b.Q4_K_M.gguf./main -m llama-3-8b.Q4_K_M.gguf -p "你好"GPU 加速(如 CUDA):
make clean && make LLAMA_CUDA=1适合:
pip install torch transformers acceleratefrom transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-8B"
)
tokenizer = AutoTokenizer.from_pretrained(
"meta-llama/Meta-Llama-3-8B"
)
inputs = tokenizer("你好", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(outputs[0]))⚠️ 注意:
| 模型 | 最低显存 |
|---|---|
| Llama 3 8B(Q4) | 6–8 GB |
| Llama 3 8B(FP16) | 16 GB |
| Llama 3 70B | 40 GB+ |
✅ 可以,Ollama 和 llama.cpp 都支持 CPU(速度较慢)
可以加:
如果你告诉我:
我可以直接给你一套最适合你的部署方案。