Meta 官方并未公开 Llama 3 训练的具体总成本,但根据模型规模、训练数据量、硬件投入及行业估算,其训练成本(仅计算算力消耗,不含人力、数据、研发等)大致在 数千万到数亿美元 区间,具体因模型版本差异较大。以下是详细拆解:
一、核心参数与行业估算
Llama 3 包含 8B、70B、405B 三个主要版本,训练成本随参数规模指数级上升:
- 8B 版本:训练数据约 15T tokens,使用 H100 GPU 集群,估算算力成本约 数百万美元(约 500 万-1000 万美元)。
- 70B 版本:训练数据约 15T tokens,算力成本约 数千万美元(约 5000 万-1 亿美元)。
- 405B 版本:训练数据约 15T tokens,使用超 1.6 万张 H100 GPU,训练时长约 8000 万 GPU 小时,按 H100 单卡每小时 1-2 美元估算,算力成本约 8 亿-16 亿美元,是成本最高的版本。
二、成本构成拆解
- 算力成本(核心):H100 GPU 是训练主力,单卡价格约 3 万美元,租赁成本每小时 1-2 美元。405B 版本需 1.6 万张 H100 运行 8000 万小时,仅算力租赁就达数亿美元。
- 数据与研发成本:Meta 投入超 15T tokens 高质量数据(含清洗、标注),以及数千名工程师研发,这部分成本未公开,但远超算力本身。
- 能源与基础设施:大规模集群的电力、冷却、数据中心维护成本,约占算力成本的 20%-30%。
三、对比与参考
- Llama 2 70B:训练成本约 200 万美元(2023 年估算),Llama 3 70B 因数据量和模型优化,成本提升约 25 倍。
- GPT-4 估算:训练成本约 1 亿美元,Llama 3 405B 成本与之接近,但 Meta 依托自研芯片和集群优化,实际成本可能更低。
四、关键说明
- Meta 未公开具体数字,以上为行业基于硬件、数据、训练时长的合理估算。
- 成本不含后续部署、迭代、应用开发等费用,仅指模型训练阶段的算力投入。
- 开源策略降低了行业复现成本,但 Meta 自身的研发投入(如数据、算法、工程)仍属巨额投入。