计算 Llama 3 的训练成本是一个复杂的问题,因为 Meta 官方并未公开完整的成本明细。不过,我们可以根据模型规模、训练数据量、硬件配置、训练时长等公开信息,结合云计算/自建集群的市场价格,进行合理估算。
训练大模型的成本主要来自以下 4 个方面:
| 成本项 | 说明 |
|---|---|
| 1. 算力成本 | GPU 租用或购买成本(最主要) |
| 2. 电力与冷却 | 数据中心电费、散热 |
| 3. 存储与网络 | 数据集、Checkpoint、集群通信 |
| 4. 人力与工程 | 分布式训练、调试、失败重试 |
实际估算中,GPU 算力成本通常占 80% 以上。
| 参数 | 数值 |
|---|---|
| 参数量 | 70B |
| 训练数据 | ~15T tokens |
| 上下文长度 | 8K |
| 训练精度 | BF16 |
| 并行策略 | FSDP / TP / PP |
[
text{FLOPs} approx 6 times N times D
]
[
6 times 70 times 10^9 times 15 times 10^{12}
= 6.3 times 10^{24} text{ FLOPs}
实际训练不会 100% 利用 GPU:
| 指标 | 典型值 |
|---|---|
| MFU(Model FLOPs Utilization) | 35%–45% |
| 取保守值 | 40% |
以 NVIDIA H100 80GB 为例:
| 指标 | 数值 |
|---|---|
| BF16 算力 | 989 TFLOPS |
| 实际可用 | ~800 TFLOPS |
[
frac{6.3 times 10^{24}}{0.4 times 800 times 10^{12}}
approx 1.97 times 10^{10} text{ 秒}
假设使用 8,192 张 H100:
[
frac{1.97 times 10^{10}}{8192} approx 2.4 times 10^6 text{ 秒}
approx 28 text{ 天}
]
| GPU | 价格 |
|---|---|
| H100 80GB | $2.5–$4 / GPU / hour |
[
8192 times 24 times 30 times 3
= 17.7 text{ 百万美元}
]
即:
~ $17–25M(Llama 3 70B)
| 项目 | 说明 |
|---|---|
| H100 单价 | ~$30,000 |
| 集群成本 | ~$245M(8,192 卡) |
| 电费 | ~$1–2M |
| 三年折旧 | 年成本显著低于云 |
| 模型 | 参数 | Token | 成本 |
|---|---|---|---|
| 8B | 8B | 15T | ~$2–3M |
| 70B | 70B | 15T | ~$17–25M |
| 405B | 405B | 15T+ | ~$80–100M+ |
[
text{Cost} approx
frac{6 times N times D}
{text{MFU} times text{GPU FLOPs}}
times
text{GPU Price per Hour}
]
Llama 3 70B 的训练成本大约在 1500–2500 万美元级别(自建更低,云计算更高),主要由 GPU 算力决定。
如果你愿意,我可以:
你打算用这个估算做什么场景?