如何训练GeneFace Plus Plus

AI技术
小华
2026-08-15

GeneFace++ 是一个基于 PyTorch 的开源高保真度、可控制的语音驱动头像(talking head)生成项目。它通常需要较强的计算资源(推荐 NVIDIA GPU,显存 ≥ 16GB)和一定的深度学习基础。

以下是根据官方 GitHub 仓库整理的完整训练流程

一、环境准备

1. 克隆仓库

git clone https://github.com/yerfor/GeneFacePlusPlus.git
cd GeneFacePlusPlus

2. 创建 Conda 环境

conda create -n genefacepp python=3.9 -y
conda activate genefacepp

3. 安装 PyTorch(以 CUDA 11.8 为例)

pip install torch==2.0.1 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

4. 安装依赖

pip install -r requirements.txt

二、数据准备

GeneFace++ 的训练数据通常来源于 单人或多人的说话视频

1. 原始数据要求

  • 视频:MP4 格式,无遮挡、正面视角
  • 音频:WAV 格式(16kHz)
  • 推荐时长:10–30 分钟(单人)

2. 数据目录结构

data/
└── my_subject/
├── videos/
│   └── raw.mp4
├── audios/
│   └── raw.wav
└── landmarks/

三、数据预处理(关键步骤)

GeneFace++ 包含多个预处理阶段。

1. 提取人脸 & 关键点

bash scripts/preprocess/extract_landmarks.sh

主要功能:

  • 人脸检测(face detection)
  • 3DMM 参数提取
  • 关键点(landmarks)保存

2. 音频特征提取

GeneFace++ 使用 HuBERT / WavLM 作为音频表示。

bash scripts/preprocess/extract_audio_features.sh

3. 构建 motion / expression 数据

bash scripts/preprocess/extract_motion.sh

四、训练流程(分阶段)

GeneFace++ 训练通常分为 3 个阶段

阶段 1:音频到运动(Audio-to-Motion)

训练音频 → 面部运动(3DMM / landmarks)

python train.py --config configs/train_audio2motion.yaml

重点参数:

  • batch_size
  • audio_encoder
  • motion_type

阶段 2:运动到视频(Motion-to-Video)

训练运动 → 面部图像生成

python train.py --config configs/train_motion2video.yaml

关键点:

  • 使用 NeRF / 2D GAN / diffusion(视分支而定)
  • 显存需求较高(≥ 16GB)

阶段 3(可选):精调 / 提升真实感

bash scripts/train/finetune.sh

五、推理测试

1. 准备测试音频

test_audio.wav

2. 运行推理

python inference.py \
--audio test_audio.wav \
--model_path checkpoints/genefacepp.pth \
--output result.mp4

六、常见训练问题

❌ CUDA OOM

  • 减小 batch_size
  • 降低 img_size
  • 使用 AMP(混合精度)

❌ 音频与嘴型不同步

  • 检查音频采样率(必须为 16kHz)
  • 确认 landmarks 是否对齐

❌ 生成视频模糊

  • 增加训练轮数
  • 使用高质量原始视频
  • 调整 GAN / diffusion 超参数

七、推荐硬件配置

项目推荐
GPURTX 3090 / 4090 / A100
显存≥ 16GB
内存≥ 32GB
存储SSD,≥ 100GB

八、官方资源


如果你愿意,我可以:

  • ✅ 帮你 选适合你显卡的训练参数
  • ✅ 给你 完整可复制的训练脚本
  • ✅ 指导你 只用 5–10 分钟视频训练
  • ✅ 帮你 改造成中文语音 / 方言 / 歌声驱动

只要告诉我你的 GPU 型号 + 数据情况 即可。

亿速云提供售前/售后服务

售前业务咨询

售后技术保障

400-100-2938

7*24小时售后电话

官方微信小程序