不要用原生 PyTorch 直接跑
✅ 推荐(按速度排序):
❌ 不推荐:
transformers + generateDeepSeek-R1 官方很大,必须量化
| 模型 | 推荐量化 |
|---|---|
| 1.5B | Q4_K_M |
| 7B | Q4_K_M / Q5_K_M |
| 8B | Q4_K_M |
| 14B+ | Q3_K / Q4_K |
示例(llama.cpp):
./llama-quantize deepseek-r1-7b-f16.gguf deepseek-r1-7b-Q4_K_M.gguf Q4_K_MWindows 上常见错误:模型在 CPU 跑
检查:
nvidia-smiOllama 设置:
set OLLAMA_NUM_GPU=1llama.cpp:
-ngl 35仅限:
pip install vllmLLM(
model="deepseek-ai/deepseek-r1-7b",
gpu_memory_utilization=0.9,
enforce_eager=False
)DeepSeek-R1 默认 context 很大,非常慢
建议:
2048–4096✅ 必做:
Ollama + Q4 量化 + GPU
vLLM + TensorRT-LLM
llama.cpp CPU + Q3 量化
你可以告诉我:
我可以直接给你 一条可复制的命令或配置。