| 用途 | 推荐配置 |
|---|---|
| 微调(LoRA / QLoRA) | 1× A100 / H100(40G+)或 2× 3090 |
| 全参数训练 | 多卡 A100 / H100 |
| 个人实验 | 1× 3090 / 4090(24G,仅 LoRA) |
✅ 显存越大越好,LLaMA3-8B 全量训练至少需要 80G+ 显存
nvidia-smi✅ LLaMA 3 推荐 CUDA 12.x
# 示例:CUDA 12.1
sudo apt install nvidia-cuda-toolkit验证:
nvcc --versionwget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.shconda create -n llama3 python=3.10 -y
conda activate llama3✅ LLaMA 3 推荐 PyTorch 2.1+
pip install torch torchvision torchaudio \
--index-url https://download.pytorch.org/whl/cu121验证:
import torch
print(torch.cuda.is_available())llama3-8b/
├── tokenizer.model
├── params.json
├── consolidated.00.pthpip install huggingface-cli
huggingface-cli login下载:
huggingface-cli download meta-llama/Meta-Llama-3-8B \
--local-dir llama3-8b-hf支持 LoRA / QLoRA / 全量训练
git clone https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory
pip install -r requirements.txt✅ 支持:
pip install transformers accelerate peft bitsandbytes datasets[
{
"instruction": "解释什么是深度学习",
"input": "",
"output": "深度学习是..."
}
]或对话格式:
{
"conversations": [
{"role": "user", "content": "你好"},
{"role": "assistant", "content": "你好,我是 LLaMA 3"}
]
}llamafactory-cli train \
--model_name_or_path meta-llama/Meta-Llama-3-8B \
--dataset my_data \
--template llama3 \
--finetuning_type lora \
--output_dir output--quantization_bit 4
--finetuning_type lora--finetuning_type fullaccelerate launch \
--multi_gpu \
train.py或:
deepspeed --num_gpus=4 train.py| 问题 | 解决 |
|---|---|
| CUDA 不匹配 | PyTorch 与 CUDA 版本对齐 |
| 显存不足 | 用 QLoRA / 减小 batch |
| tokenizer 报错 | 使用官方 tokenizer |
| 权重加载失败 | 确保 HF 或 Meta 格式 |
✅ 新手
✅ 进阶
你可以直接告诉我:
我可以给你 一份完全针对你机器的训练命令 ✅