OpenELM 是 Apple 开源的一系列高效语言模型(Open Efficient Language Models),包含从 270M 到 3B 不同参数规模的版本。在离线使用(本地推理)时,显存占用主要取决于模型参数量、量化方式、推理框架以及是否启用上下文缓存/KV Cache。
| 模型规模 | 参数精度 | 显存占用(约) | 说明 |
|---|---|---|---|
| OpenELM-270M | FP16 | ~0.6 GB | 极小模型,CPU 也可跑 |
| OpenELM-270M | INT8 | ~0.3 GB | 量化后更轻 |
| OpenELM-450M | FP16 | ~1.0 GB | |
| OpenELM-1.1B | FP16 | ~2.3 GB | 入门级显卡可用 |
| OpenELM-1.1B | INT4 | ~0.7 GB | 适合边缘设备 |
| OpenELM-3B | FP16 | ~6.5 GB | 常见离线部署规模 |
| OpenELM-3B | INT8 | ~3.3 GB | |
| OpenELM-3B | INT4 | ~1.8 GB | 可在 2GB 显存卡运行 |
注:以上未包含 KV Cache(长文本会额外增加显存)。
如果你能说明:
我可以给你更精确的显存估算或部署方案。