DeepSeek-R1 支持量化。
根据官方信息,DeepSeek-R1 系列模型(包括蒸馏后的小模型)均支持量化技术,以降低推理时的显存占用和计算成本。以下是具体说明:
deepseek-ai/DeepSeek-R1-GGUF),支持多种量化等级(如 Q4_K_M、Q5_K_M、Q8_0 等),可通过 llama.cpp、Ollama 等工具加载。AutoAWQ、GPTQ-for-LLaMa)已适配 DeepSeek-R1,支持 4-bit/8-bit 量化,适合 GPU 推理。torch.quantization 或 bitsandbytes 库进行动态/静态量化,但需自行适配。Ollama 或 llama.cpp,适合本地或边缘设备。llama.cpp,AWQ 需 vLLM 或 TGI)。如果需要具体量化步骤或工具推荐,可以进一步说明你的部署环境(如 GPU/CPU、显存大小等)。