RTX 3090 Ti 拥有 24GB GDDR6X 显存,在消费级显卡里属于“大显存”梯队,能跑的模型规模主要取决于量化方式、上下文长度、是否开多卡/CPU卸载。下面按常见场景给你一个实用参考(单卡 3090 Ti):
1. 大语言模型(LLM)
- 7B 模型
- FP16:约 14GB,轻松跑
- 4-bit 量化(GPTQ/AWQ):约 4–6GB,极流畅,上下文可开很长
- 13B 模型
- FP16:约 26GB(单卡放不下,需卸载)
- 4-bit 量化:约 8–10GB,单卡流畅
- 30B / 33B 模型
- 4-bit 量化:约 18–20GB,单卡可跑,但上下文不能太长
- 65B / 70B 模型
- 4-bit 量化:约 35–40GB,单卡放不下
- 可 CPU 卸载或部分层放显存,但速度很慢,不推荐
- 综述
- 单卡 3090 Ti: comfortably 跑 13B 以内,极限 30B 量化
- 若双 3090 Ti(48GB):可跑 70B 4-bit
2. 图像生成(SD / 扩散模型)
- Stable Diffusion 1.5 / SDXL:完全无压力
- SDXL + 高分辨率 + ControlNet + 多个插件:仍可在 24GB 内
- 训练(LoRA / DreamBooth):SD 类单卡可训
- 大模型如 SD3、Flux 推理可跑;Flux 训练较吃力,需优化
3. 视觉 / 多模态
- LLaVA、Qwen-VL 等 7B/13B 多模态:可跑
- 大规模视觉模型(如 SAM、 grounding DINO):推理没问题
4. 训练 / 微调
- 全参微调:7B 以内较现实
- LoRA / QLoRA:13B 甚至 30B 可微调(QLoRA 显存占用低)
总结一句话
RTX 3090 Ti 单卡能流畅跑 13B 大模型(量化),极限跑 30B 量化模型;70B 及以上需要多卡或强 CPU 卸载。
如果你告诉我你是推理还是训练、用什么框架(Ollama / vLLM / transformers)、上下文要多长,我可以给你更精确的配置建议。