主页

6 个主流音视频生成模型推理性能

6 个主流音视频生成模型推理性能

这是一份关于当前主流音视频生成模型的推理性能实测记录。统一在 H20 (96GB) 单卡(MAGI-2 除外)上,以 640×640、5 秒视频为基准,对 MOVA、LTX-2.3、Bernini-S2V、MiniMax-H3、MAGI-2 Preview、LTX-2.5 六个模型进行推理耗时、显存与效果对比,并额外加入 MiniMax-H3 Turbo 作为 H3 的加速变体一并测试。

1. 测试背景与条件

视频生成模型的选型,不能只看论文里的效果 demo,推理成本往往才是落地的决定性因素。这次实测的目标,是在统一的输入条件和硬件环境下,横向对比几个主流音视频生成模型,得到一个可用于工程选型的量化结论。

统一测试条件:

  • 分辨率 / 时长:640×640,5 秒视频;
  • 硬件:NVIDIA H20 (96GB);
  • 推理框架:FlashAttention 3 + CUDA 12.6;
  • 部署:除 MAGI-2 Preview(需 8×H20)外,其余模型均单卡(1×H20)可跑。

覆盖的模型共 6 个主流模型 + 1 个加速变体

模型机构参数规模
MOVAOpenMOSS(开源)32B(18B 激活)
LTX-2.3Lightricks(开源)22B DiT
Bernini-S2VByteDance(开源)14B
MiniMax-H3MiniMax(Base 开源)33B dense
MAGI-2 PreviewSand.ai(开源)114B(6B 激活,MoE)
LTX-2.5Lightricks(开源)22B DiT
MiniMax-H3 TurboMiniMax(加速变体)33B dense

2. 模型概览

MOVA(OpenMOSS)

面向「可扩展、音画同步」的视频-音频联合生成模型。采用双塔 DiT 架构,主 DiT 32B(18B 激活),配合 1.3B 的 Audio DiT 和 2.6B 的 Bridge 模块,将视频与音频两条塔桥接起来,实现 8 秒 720p 的同步输出。

  • 输入:Image + Text
  • 输出:8s · 720p
  • 架构:双塔 DiT + Audio DiT 1.3B + Bridge 2.6B

LTX-2.3(Lightricks)

高效音视频联合基础模型,22B 双流 DiT,文本侧使用 Gemma 3,视频侧采用更轻快的 Conv VAE 解码器,在保持画质的同时显著降低解码开销。

  • 输入:Text + Image + Video
  • 输出:Audio + Video
  • 架构:22B 双流 DiT + Conv VAE

Bernini-S2V(ByteDance)

基于 Wan 架构演进的语音驱动视频生成模型。从 Wan2.2 升级到 Wan-S2V Renderer,核心是引入音频输入,实现音频驱动的说话/动作视频生成,且原生支持统一的视频编辑框架。

  • 输入:Text + Image + Audio
  • 输出:音频驱动的视频生成
  • 底座:Wan2.2 → Wan-S2V(增加 Audio 输入)

MiniMax-H3(MiniMax)

全能(Omni)生成系统,33B dense 的单流 Omni-Transformer,统一处理图像、文本、视频、音频四模态,输出支持 15 秒、2K、立体声。

  • 输入:Img + Text + Video + Audio
  • 输出:15s · 2K · 立体声
  • 架构:单流 Omni-Transformer

MAGI-2 Preview(Sand.ai)

以 MoE 架构大幅扩展视频生成规模,总参数高达 114B,但激活仅约 6B,在推理时用稀疏激活换取单步速度。也是本次唯一需要多卡(8×H20)部署的模型。

  • 输入:Text + Image
  • 输出:10s · 1080p
  • 架构:MoE 单流 Transformer

LTX-2.5(Lightricks)

LTX-2.3 的升级版,换用更强的 Gemma 4 12B 文本编码器与更高画质的 DiffVAE 解码器,并新增多镜头生成与 Diffusion Decoder 能力。

  • 输入:Text + Image + Video
  • 新特性:多镜头生成 · Diffusion Decoder

3. 推理性能对比

模型GPU推理步数总耗时平均单步峰值显存
MOVA1×H208 steps2min 40s20s/step71.7G
LTX-2.31×H208 + 2 (V2V)1min 16s7.6s/step80G
Bernini-S2V1×H204 steps1min 30s22.5s/step50G
MiniMax-H31×H2050 steps13min 46s16.5s/step82G
MiniMax-H3 Turbo1×H204 steps1min 13s18.4s/step83G
MAGI-2 Preview8×H20100 steps6min 57s4.17s/step63G
LTX-2.51×H208 (320²) + 3 (640²)20s1.82s/step80G

关键结论

  • 最快总耗时:LTX-2.5 以 20 秒遥遥领先(8+3 步、1.82s/step),是唯一进入半分钟内的模型,碾压第二名一个数量级;
  • 最快单步:LTX-2.5 的 1.82s/step 第一,其次 MAGI-2 的 4.17s/step(靠 8 卡并行 + MoE 6B 激活);
  • 最低显存:Bernini-S2V 仅需 50G,单卡轻松可跑,是显存最友好的选择;
  • 部署门槛:除 MAGI-2(需 8×H20)外,其余 6 个模型均 1×H20 即可部署;
  • 最长耗时:MiniMax-H3 需要 50 步,总耗时 13min 46s;其 Turbo 版砍到 4 步后降至 1min 13s,步数蒸馏对 H3 的收益十分明显。

4. 架构对比

维度MOVALTX-2.3Bernini-S2VMiniMax-H3MAGI-2LTX-2.5
总参数32B22B (DiT)14B (Dense)33B (Dense)114B (MoE)22B (DiT)
激活参数18B22B14B33B~6B22B
统一音视频✅ Bridge✅ 非对称双流✅ Wan-S2V (Audio)✅ 单流 Omni✅ 单流 MoE✅ 双流
文本编码器UMT5Gemma 3UMT5Qwen3-VL-32BQwen3.5-27BGemma 4 12B
位置编码Aligned RoPE3D+1DSA-3D RoPE3D MM-RoPE3D RoPE3D RoPE
推理框架DiffSynthdiffusersDiffSynthSGLang/ComfyUISGLangdiffusers/ComfyUI
视频编辑✅ 统一框架

从架构维度可以看出几个趋势:

  • 统一多模态是主流方向,六个模型都在不同层面实现了音视频统一建模,但实现路径差异很大:MOVA 用 Bridge 桥接双塔,H3 用单流 Omni,LTX 用非对称双流;
  • 文本编码器全面转向大语言模型(Gemma、Qwen、UMT5),从专有小模型演进到通用 LLM 骨干;
  • 视频编辑能力目前只有 Bernini-S2V 原生支持统一框架,是它的差异化优势;
  • 推理框架呈现分化:轻量模型多用 diffusers/DiffSynth,重量级 MoE 模型则依赖 SGLang。

5. 效果对比(3 组典型场景)

同一 Prompt 下,7 路模型的输出对比(含 MiniMax-H3 Turbo)。每组视频均含音频,点击可播放。

场景 #0 — 樱花列车

女性角色白色连衣裙,乘坐小火车穿越樱花海

MOVA · 8步 · 2m40s
LTX-2.3 · 8+2步 · 1m16s
Bernini-S2V · 4步 · 1m30s
MiniMax-H3 · 50步 · 13m46s
H3 Turbo · 4步 · 1m13s
MAGI-2 · 100步 · 6m57s
LTX-2.5 · 8+3步 · 20s

场景 #5 — 城市夜景

男性角色 + 企鹅,繁华城市夜景,红灯笼与节日灯光

MOVA · 8步 · 2m40s
LTX-2.3 · 8+2步 · 1m16s
Bernini-S2V · 4步 · 1m30s
MiniMax-H3 · 50步 · 13m46s
H3 Turbo · 4步 · 1m13s
MAGI-2 · 100步 · 6m57s
LTX-2.5 · 8+3步 · 20s

场景 #10 — 溪流岸边

女性角色蓝白长裙,阳光斑驳的溪流岸边与野花

MOVA · 8步 · 2m40s
LTX-2.3 · 8+2步 · 1m16s
Bernini-S2V · 4步 · 1m30s
MiniMax-H3 · 50步 · 13m46s
H3 Turbo · 4步 · 1m13s
MAGI-2 · 100步 · 6m57s
LTX-2.5 · 8+3步 · 20s

6. 数据来源

推理数据基于 H20 (96GB) GPU 实测,报告生成时间 2026-08。