用 Ollama(官方推荐,一条命令搞定)
curl -fsSL https://ollama.com/install.sh | sh安装完成后验证:
ollama --versionollama run llama3✅ 这会:
ollama run llama3:8b
ollama run llama3:70b # 显存 ≥ 40GB| 模型 | 最低显存 | 推荐 |
|---|---|---|
| llama3:8b | 8GB | 16GB |
| llama3:70b | 40GB+ | A100 / 多卡 |
pip install ollamaimport ollama
response = ollama.chat(
model='llama3',
messages=[{'role': 'user', 'content': '你好'}]
)
print(response['message']['content'])pip install transformers acceleratefrom transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct",
device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct"
)⚠️ 需要:
export OLLAMA_MODELS=/data/ollamaLlama 3 中文能力一般,建议:
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3如果你告诉我:
我可以给你定制最优方案。