| 场景 | 难度 | 说明 |
|---|---|---|
| 只跑模型(推荐) | ⭐⭐ | 用 Ollama,10 分钟完成 |
| 本地微调 / 训练 | ⭐⭐⭐⭐ | 需要显卡、环境配置 |
| 源码编译 + 自定义 | ⭐⭐⭐⭐⭐ | 不推荐新手 |
curl -fsSL https://ollama.com/install.sh | sh支持:
ollama run llama3默认是:
ollama run llama3:70b| 模型 | 最低内存 | 推荐 |
|---|---|---|
| 8B | 8GB | 16GB |
| 70B | 32GB+ | 64GB+ / GPU |
适合:
conda create -n llama3 python=3.10
conda activate llama3
pip install torch transformers acceleratefrom transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct",
device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained(
"meta-llama/Meta-Llama-3-8B-Instruct"
)
prompt = "你好,介绍一下你自己"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(outputs[0]))⚠️ 注意:
huggingface-cli login你可以直接告诉我:
我可以给你精确到命令级别的安装方案。