NVIDIA Hopper 架构(以 H100 为代表)在显存带宽方面的优势,主要体现在以下几个方面:
1. 采用 HBM3 高带宽显存
- H100 使用 HBM3(部分型号为 HBM2e),相比 A100 的 HBM2e:
- 显存带宽:H100 可达 3.35 TB/s(SXM5 版本)
- A100 约为 1.5–2.0 TB/s
- 带宽几乎翻倍,特别有利于大模型训练和推理中的大规模参数读取。
2. 更宽的总线与更高堆叠
- Hopper 的 HBM 使用更宽的内存总线与更高堆叠层数
- 单颗 HBM3 堆栈带宽显著提升,降低显存瓶颈
3. Transformer Engine 与显存效率协同
- Hopper 引入 Transformer Engine
- 配合高带宽显存,可:
- 使用 FP8 高效计算
- 减少显存占用与数据搬运
- 让带宽优势更易被计算单元“吃满”
4. 对大模型与 MoE 友好
- 大模型(如 GPT、MoE 模型)对显存带宽极度敏感
- Hopper 的高带宽显著减少:
- 参数加载延迟
- 激活值搬运时间
- 在千亿/万亿参数场景下优势明显
5. NVLink 与显存带宽形成系统级优势
- Hopper 支持 第四代 NVLink
- 多卡间带宽高,配合单卡高显存带宽:
- 减少跨卡通信等待
- 提升整体有效带宽利用率
总结
Hopper 架构的显存带宽优势可以概括为:
HBM3 带来的超高带宽 + Transformer Engine 的高效利用 + NVLink 系统级协同
这使得 H100 在 LLM 训练、推理和科学计算中对显存带宽敏感的任务上,明显领先于前代架构。