GeneFace++ 是支持长视频的,这也是它相比初代 GeneFace 的一个主要改进点。
简单说明一下:
- GeneFace(初代):主要面向短视频/短语音驱动,对长视频容易出现累积误差、嘴型漂移、显存占用过高等问题。
- GeneFace++:
- 引入了更高效的 pose-free 训练与推理框架
- 使用了更好的 唇形对齐与时序建模方式
- 显存和推理成本更低
- 官方实验和社区实践中都验证过:可以处理数分钟甚至更长的一段视频/音频驱动任务
不过需要注意几点现实限制:
- 不是“无限长”
- 通常建议按“分钟级”使用(比如 1–5 分钟一段)
- 特别长的(比如十几分钟以上)一般还是需要分段生成再拼接,避免质量下降
- 依赖音频质量
- 长视频里如果音频有噪声、停顿多、语速变化大,效果会受影响
- 显存与推理时间
- 长视频推理时间明显更长
- 消费级显卡(如 24G 显存)也能跑,但越长越慢
如果你是想做:
GeneFace++ 是目前开源方案里比较合适的选择之一。
如果你愿意,我可以:
- 给你 GeneFace++ 长视频的最佳实践参数
- 或对比 GeneFace++ / SadTalker / MuseTalk / Wav2Lip 在长视频上的表现