Llama 3 405B 拥有 4050亿参数,是目前开源模型中规模最大的之一。参数越多,训练时所需的内存、计算和通信开销呈指数级增长。
采用 分组查询注意力(GQA) 等优化结构,虽提升了推理效率,但增加了训练时的计算和工程复杂度。
预训练数据达 15万亿+ token(Llama 3 405B),是Llama 2的近 7倍,数据量是训练成本的核心驱动因素之一。
数据需经过严格清洗、去重、过滤与多轮质量评估,涉及大量人工与计算资源。
训练405B模型需 数千张H100/A100级GPU,集群规模远超常规模型。例如,Meta可能使用了 超过1.6万张H100 进行训练。
405B模型训练耗时 约8000万GPU小时,按H100单卡每小时约1–2美元估算,仅GPU租赁成本就达 数亿美元。
大规模GPU集群需配套高速网络(如InfiniBand)、存储系统、冷却与电力系统,基础设施投入巨大。
长时间训练中需应对硬件故障、梯度爆炸、通信中断等问题,需开发专用监控、检查点恢复与自动重启系统。
包括 监督微调(SFT)、人类反馈强化学习(RLHF)、直接偏好优化(DPO) 等多轮优化,需大量算力与人工标注。
Llama 3系列包含8B、70B、405B等多个版本,每个版本均需独立训练与调优,进一步推高总成本。
| 模型 | 参数量 | 训练数据(token) | 估算GPU小时 | 估算成本(美元) |
|---|---|---|---|---|
| Llama 2 70B | 700亿 | 2万亿 | 约170万 | 数千万 |
| Llama 3 405B | 4050亿 | 15万亿+ | 约8000万 | 数亿 |
| GPT-4(估算) | 约1.8万亿 | 约13万亿 | 约2亿+ | 超10亿 |
Llama 3训练成本高企,本质是 “更大模型 + 更多数据 + 更强算力 + 更复杂工程” 的必然结果。虽然Meta通过开源策略摊薄了部分研发成本,但单次训练的绝对投入仍处于行业顶尖水平。这也解释了为何目前仅有少数机构具备训练此类模型的能力。