GeneFace++ 的音频适配性强,核心源于其音频无关(Audio-Agnostic)的头部运动建模 + 鲁棒特征解耦 + 通用大模型预训练等设计,让模型摆脱了对特定音色、语言或说话人的依赖,具体可拆解为以下几点:
GeneFace++ 不采用“音频直接映射面部”的强绑定范式,而是把任务拆分:
| 设计 | 对适配性的作用 |
|---|---|
| NeRF-based 通用头部先验 | 用 NeRF 学习头部结构的通用先验,不依赖特定人的面部绑定,换音频/换人都能复用几何基础 |
| 音频无关运动表示 | 把音频转成韵律、节奏、时长等通用运动信号,而非原声波形/梅尔频谱,避免音色、语言差异干扰 |
| 跨模态对齐训练 | 训练时对齐音频与运动的弱关联,而非强对应,让模型学到“说话→动”的通用规律,而非某个人/某段音频的特例 |
| 鲁棒特征提取 | 音频特征抽取更关注时序结构,而非声学细节,减少不同录音质量、音色的影响 |
传统说话人生成常采用音频-面部直接映射,容易过拟合到训练集的音色、语言、说话人;GeneFace++ 把音频作为“运动触发器”,而非生成唯一依据,因此:
简单来说:它学的不是“某段音频对应某张脸”,而是“人在说话时通用的运动规律”,所以换什么音频都能适配。