| 组件 | 推荐配置 |
|---|---|
| GPU | RTX 4080 (16GB 显存) ✅ |
| CPU | i7 / R7 及以上 |
| 内存 | 32GB+ DDR4/DDR5 |
| 硬盘 | NVMe SSD ≥ 100GB |
| 电源 | ≥ 750W |
✅ RTX 4080 可流畅运行 7B~13B 量化模型,部分 30B 量化模型也可尝试。
nvidia-smi # 验证驱动nvcc --versionpython --versionconda create -n llm python=3.10
conda activate llm| 模型 | 参数量 | 推荐量化 | 显存占用 |
|---|---|---|---|
| LLaMA 3 8B | 8B | Q4_K_M | ~6–8GB |
| Mistral 7B | 7B | Q4_K_M | ~6GB |
| ChatGLM3-6B | 6B | FP16 / INT4 | ~8–12GB |
| Qwen2.5-7B | 7B | Q4_K_M | ~7GB |
| Yi-1.5-9B | 9B | Q4_K_M | ~9GB |
| LLaMA 3 13B | 13B | Q3_K_M | ~10–12GB |
⚠️ 不建议:
https://ollama.com/downloadollama run llama3
ollama run qwen2.5http://localhost:11434✅ 优点:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Releasemodels/llama3-8b-q4_k_m.gguf./llama-cli \
-m models/llama3-8b-q4_k_m.gguf \
-p "你好" \
-n 256 \
-ngl 32✅ 优点:
git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
pip install -r requirements.txtpython server.py --model llama3 --loader llamacpp✅ 支持:
from fastapi import FastAPI
import requests
app = FastAPI()
@app.get("/chat")
def chat(q: str):
r = requests.post(
"http://localhost:11434/api/generate",
json={"model": "llama3", "prompt": q, "stream": False}
)
return r.json()✅ 必做:
✅ 进阶:
n-gpu-layers[ 用户 ]
↓
[ Web / 微信 / Telegram ]
↓
[ FastAPI ]
↓
[ Ollama / vLLM ]
↓
[ RTX 4080 本地推理 ]❌ 不能(云端模型)
✅ 可以,但必须 Q3 / Q4 量化
✅ 推荐:
你可以告诉我:
我可以直接给你一套可复制的完整部署脚本。