batch_size(推理也常有影响)--without_teacher 或 lighter 模型GeneFace++ 有:
优先用 lite
很多实现支持:
--cpu-offload或手动把:
torch.cuda.empty_cache()在代码中推理循环里加:
import torch
torch.cuda.empty_cache()mobile net / tiny-nerfnum_samples)batch_size = 1accumulate_grad_batches = 4~8img_sizetorch.cuda.amp.autocast()通常能省 30%~50% 显存
如果代码支持:
deepspeed --num_gpus=1 train.py --deepspeed ds_zero2.json| 显存 | 建议 |
|---|---|
| < 8GB | 只推理 lite 模型 |
| 8–12GB | 推理可行,训练困难 |
| 16GB+ | 可训练完整模型 |
| 24GB+ | 较舒服 |
nvidia-smi 看是否被其他进程占显存CUDA_VISIBLE_DEVICES=0 指定单卡如果你只是想跑起来:
batch_size=1如果你愿意,可以告诉我:
我可以直接给你对应命令或改哪几行代码。