GeneFace++(GeneFace Plus Plus)在训练和推理时的显存占用,主要受以下几个方面影响:
GeneFace++ 包含多个子模块(如音素编码器、嗓音转换 / VC 模型、NeRF / 渲染网络等),模型越大,参数和中间激活占显存越多。
如果用了 NeRF 类渲染(如体液辐射场、动态辐射场),训练时每帧采样射线和采样点会显著增加显存。
若使用扩散模型做唇形或语音驱动,UNet 类结构本身就很吃显存。
最直接因素。batch 越大,同时处理的视频帧 / 音频片段越多,显存线性增长。
高分辨率(如 512×512 以上)和长序列会放大显存消耗。
NeRF 每条射线采样点越多,显存越高。
处理长时序(如多秒连续视频)比单帧更占显存。
开启 AMP / FP16 通常能显著减少显存。
mel、hubert、wav2vec 等特征维度影响编码器显存。
有些 pipeline 会先把音频编码存下来,减少重复计算,但缓存策略也会影响峰值显存。
实时模式通常需要更小 batch,但渲染分辨率影响大。
高分辨率 + 高帧率推理显存和算力都吃紧。
如同时加载 ASR、VC、渲染模型,会叠加占用。
不同版本显存管理效率不同。
长训练或频繁分配释放张量可能导致碎片,实际占用高于模型理论值。
GeneFace++ 显存主要受:
模型结构 + batch size + 分辨率 + NeRF 采样数 + 序列长度 + 精度设置 影响最大。
如果你是想问“为什么训练爆显存”或“怎么省显存”,可以告诉我你是训练还是推理、用的什么配置(分辨率 / batch / 显卡),我可以给更具体的建议。