curl -fsSL https://ollama.com/install.sh | sh安装完成后验证:
ollama --versionollama run llama3ollama run llama3:70b首次运行会自动下载模型(约 4.7GB / 39GB)
ollama run llama3import ollama
response = ollama.chat(
model="llama3",
messages=[
{"role": "user", "content": "用中文介绍一下LLaMA 3"}
]
)
print(response["message"]["content"])~/.ollama/modelspip install huggingface_hub
huggingface-cli loginpip install transformers accelerate torchfrom transformers import AutoTokenizer, AutoModelForCausalLM
model_id = "meta-llama/Meta-Llama-3-8B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto"
)
prompt = "用中文介绍一下LLaMA 3"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))✅ 推荐 至少 16GB 显存(8B)
| 模型 | 推荐配置 |
|---|---|
| Llama 3 8B | RTX 3060 16G / 3090 |
| Llama 3 70B | A100 / H100 |
| CPU 运行 | 可,但很慢 |
CPU 运行:
OLLAMA_CPU_ONLY=1 ollama run llama3✅ 可以(Llama 3 社区许可)
✅ 下载后完全本地运行
llama3:8b-instruct你可以告诉我:
我可以给你 最合适的部署方案 + 完整代码。