curl -fsSL https://ollama.com/install.sh | sh安装完成后验证:
ollama --versionollama run llama3ollama run llama3:70bollama list # 查看已下载模型
ollama rm llama3 # 删除模型
ollama serve # 启动 API 服务pip install transformers accelerate torchfrom transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "你好,介绍一下你自己"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))⚠️ 注意:
适合:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make从 Hugging Face 下载,例如:
wget https://huggingface.co/Meta-Llama/Meta-Llama-3-8B-Instruct-GGUF/resolve/main/llama3-8b-instruct-q4_0.gguf./main -m llama3-8b-instruct-q4_0.gguf -p "你好" -n 200| 模型 | 显存 | CPU | 推荐方式 |
|---|---|---|---|
| LLaMA 3 8B | ≥ 8GB | 16GB+ | Ollama |
| LLaMA 3 70B | ≥ 40GB | 64GB+ | Ollama / llama.cpp |
| CPU 跑 | 无 | 32GB+ | llama.cpp |
你可以告诉我:
我可以直接给你最优方案 + 具体命令。