推理延迟主要来自:
Hopper 的优化重点在 Decode:
| 维度 | Ampere (A100) | Hopper (H100) |
|---|---|---|
| 计算精度 | FP16 / INT8 | FP8 + FP16 |
| 显存带宽 | 2.0 TB/s | 3.35 TB/s |
| Transformer | 无专用 | Transformer Engine |
| 大模型延迟 | 高 | 明显降低 |
| 能效比 | 中 | 高 |
Hopper 通过 FP8 + Transformer Engine + HBM3 + 软件栈协同,在“计算—显存—通信”三层同时压缩延迟,尤其适合大模型和长上下文推理。
如果你愿意,我也可以: