RTX 4080 可流畅运行以下模型(量化后):
| 模型规模 | 推荐量化精度 | 显存占用 | 效果 |
|---|---|---|---|
| 7B(如 Llama 3 7B、Qwen2 7B) | FP16 / INT8 | 8–12GB | 速度快,日常对话足够 |
| 13B(如 Llama 3 13B、Qwen2 14B) | INT4 | 10–14GB | 效果更好,显存接近满载 |
| 30B+ | INT4 | 需 20GB+ | 不推荐(可能溢出) |
推荐模型:
Ollama 是专为本地运行 LLM 设计的工具,自动管理模型和显存。
curl -fsSL https://ollama.com/install.sh | sh打开终端,执行:
ollama run qwen2:7b # 中文模型
ollama run llama3:8b # 英文模型Ollama 会自动下载模型并调用 RTX 4080 推理。
安装 Open WebUI(类似 ChatGPT 界面):
pip install open-webui
open-webui servehttp://localhost:8080,选择 Ollama 模型即可。适合需要自定义逻辑或微调的场景。
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install transformers accelerate bitsandbytes gradio创建 chat.py:
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_path = "Qwen/Qwen2.5-7B-Instruct" # 从 Hugging Face 下载
tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(
model_path,
torch_dtype=torch.float16,
device_map="auto" # 自动使用 GPU
)
# 对话循环
while True:
user_input = input("你: ")
if user_input.lower() in ["exit", "quit"]:
break
inputs = tokenizer(user_input, return_tensors="pt").to("cuda")
outputs = model.generate(**inputs, max_new_tokens=200)
response = tokenizer.decode(outputs[0], skip_special_tokens=True)
print("机器人:", response.split("用户:")[-1].strip())python chat.pymodel = AutoModelForCausalLM.from_pretrained(
model_path,
load_in_4bit=True, # INT4 量化
device_map="auto"
)model = AutoModelForCausalLM.from_pretrained(
model_path,
torch_dtype=torch.float16,
attn_implementation="flash_attention_2"
)max_new_tokens=512 避免显存溢出。llama3:8b-q4_0)。ollama search qwen。如果需要 知识库接入(如本地文档问答)或 多模态(图片+文字),可进一步扩展 RAG 或视觉模型(如 LLaVA)。