GeneFace++ 的训练速度“中等偏慢”,并不能算“极快”的模型,但相比它的上一代 GeneFace 已经做了显著的速度优化(它主打的目标之一是“加速”)。
具体可以从以下几个方面来说明:
GeneFace++ 本质上是基于 NeRF(神经辐射场) 的模型,而 NeRF 类模型的通病就是:
即使 GeneFace++ 做了加速,它仍然需要:
这些叠加在一起,训练时间通常以“天”为单位(在单卡或双卡 3090/4090 上)。
GeneFace++ 的核心改进之一就是 训练与推理加速:
因此:
GeneFace++ 比 GeneFace 快很多,但依然比基于 2D GAN 的方案(如 Wav2Lip)慢得多。
以下为常见配置下的粗略估计(非官方,仅供参考):
| 硬件 | 数据量 | 训练阶段 | 估算时间 |
|---|---|---|---|
| 1×RTX 3090 / 4090 | 10 分钟视频 | 人脸 NeRF | 1~2 天 |
| 同上 | 同上 | 声学驱动模块 | 数小时~1 天 |
| 同上 | 更长视频 | 完整训练 | 3~5 天 |
数据质量越高、视频越长,训练越慢。
GeneFace++ 在 推理阶段是相对快的(相比原始 NeRF):
GeneFace++ 在“高质量 3D 说话人生成”里算训练较快的,但整体仍属于“慢速训练、中速推理”的模型。
如果你告诉我你的 显卡型号、视频时长、是否只做中文/英文,我可以给你一个更贴近你实际的训练时间预估。