RTX3090Ti跑AI能多大模型

显卡
小华
2026-10-01

RTX 3090 Ti 拥有 24GB GDDR6X 显存,在消费级显卡里属于“大显存”梯队,能跑的模型规模主要取决于量化方式、上下文长度、是否开多卡/CPU卸载。下面按常见场景给你一个实用参考(单卡 3090 Ti):

1. 大语言模型(LLM)

  • 7B 模型
  • FP16:约 14GB,轻松跑
  • 4-bit 量化(GPTQ/AWQ):约 4–6GB,极流畅,上下文可开很长
  • 13B 模型
  • FP16:约 26GB(单卡放不下,需卸载)
  • 4-bit 量化:约 8–10GB,单卡流畅
  • 30B / 33B 模型
  • 4-bit 量化:约 18–20GB,单卡可跑,但上下文不能太长
  • 65B / 70B 模型
  • 4-bit 量化:约 35–40GB,单卡放不下
  • 可 CPU 卸载或部分层放显存,但速度很慢,不推荐
  • 综述
  • 单卡 3090 Ti: comfortably 跑 13B 以内,极限 30B 量化
  • 若双 3090 Ti(48GB):可跑 70B 4-bit

2. 图像生成(SD / 扩散模型)

  • Stable Diffusion 1.5 / SDXL:完全无压力
  • SDXL + 高分辨率 + ControlNet + 多个插件:仍可在 24GB 内
  • 训练(LoRA / DreamBooth):SD 类单卡可训
  • 大模型如 SD3、Flux 推理可跑;Flux 训练较吃力,需优化

3. 视觉 / 多模态

  • LLaVA、Qwen-VL 等 7B/13B 多模态:可跑
  • 大规模视觉模型(如 SAM、 grounding DINO):推理没问题

4. 训练 / 微调

  • 全参微调:7B 以内较现实
  • LoRA / QLoRA:13B 甚至 30B 可微调(QLoRA 显存占用低)

总结一句话

RTX 3090 Ti 单卡能流畅跑 13B 大模型(量化),极限跑 30B 量化模型;70B 及以上需要多卡或强 CPU 卸载。
如果你告诉我你是推理还是训练、用什么框架(Ollama / vLLM / transformers)、上下文要多长,我可以给你更精确的配置建议。
亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序