6 个主流音视频生成模型推理性能
这是一份关于当前主流音视频生成模型的推理性能实测记录。统一在 H20 (96GB) 单卡(MAGI-2 除外)上,以 640×640、5 秒视频为基准,对 MOVA、LTX-2.3、Bernini-S2V、MiniMax-H3、MAGI-2 Preview、LTX-2.5 六个模型进行推理耗时、显存与效果对比,并额外加入 MiniMax-H3 Turbo 作为 H3 的加速变体一并测试。
1. 测试背景与条件
视频生成模型的选型,不能只看论文里的效果 demo,推理成本往往才是落地的决定性因素。这次实测的目标,是在统一的输入条件和硬件环境下,横向对比几个主流音视频生成模型,得到一个可用于工程选型的量化结论。
统一测试条件:
- 分辨率 / 时长:640×640,5 秒视频;
- 硬件:NVIDIA H20 (96GB);
- 推理框架:FlashAttention 3 + CUDA 12.6;
- 部署:除 MAGI-2 Preview(需 8×H20)外,其余模型均单卡(1×H20)可跑。
覆盖的模型共 6 个主流模型 + 1 个加速变体:
| 模型 | 机构 | 参数规模 |
|---|---|---|
| MOVA | OpenMOSS(开源) | 32B(18B 激活) |
| LTX-2.3 | Lightricks(开源) | 22B DiT |
| Bernini-S2V | ByteDance(开源) | 14B |
| MiniMax-H3 | MiniMax(Base 开源) | 33B dense |
| MAGI-2 Preview | Sand.ai(开源) | 114B(6B 激活,MoE) |
| LTX-2.5 | Lightricks(开源) | 22B DiT |
| MiniMax-H3 Turbo | MiniMax(加速变体) | 33B dense |
2. 模型概览
MOVA(OpenMOSS)
面向「可扩展、音画同步」的视频-音频联合生成模型。采用双塔 DiT 架构,主 DiT 32B(18B 激活),配合 1.3B 的 Audio DiT 和 2.6B 的 Bridge 模块,将视频与音频两条塔桥接起来,实现 8 秒 720p 的同步输出。
- 输入:Image + Text
- 输出:8s · 720p
- 架构:双塔 DiT + Audio DiT 1.3B + Bridge 2.6B
LTX-2.3(Lightricks)
高效音视频联合基础模型,22B 双流 DiT,文本侧使用 Gemma 3,视频侧采用更轻快的 Conv VAE 解码器,在保持画质的同时显著降低解码开销。
- 输入:Text + Image + Video
- 输出:Audio + Video
- 架构:22B 双流 DiT + Conv VAE
Bernini-S2V(ByteDance)
基于 Wan 架构演进的语音驱动视频生成模型。从 Wan2.2 升级到 Wan-S2V Renderer,核心是引入音频输入,实现音频驱动的说话/动作视频生成,且原生支持统一的视频编辑框架。
- 输入:Text + Image + Audio
- 输出:音频驱动的视频生成
- 底座:Wan2.2 → Wan-S2V(增加 Audio 输入)
MiniMax-H3(MiniMax)
全能(Omni)生成系统,33B dense 的单流 Omni-Transformer,统一处理图像、文本、视频、音频四模态,输出支持 15 秒、2K、立体声。
- 输入:Img + Text + Video + Audio
- 输出:15s · 2K · 立体声
- 架构:单流 Omni-Transformer
MAGI-2 Preview(Sand.ai)
以 MoE 架构大幅扩展视频生成规模,总参数高达 114B,但激活仅约 6B,在推理时用稀疏激活换取单步速度。也是本次唯一需要多卡(8×H20)部署的模型。
- 输入:Text + Image
- 输出:10s · 1080p
- 架构:MoE 单流 Transformer
LTX-2.5(Lightricks)
LTX-2.3 的升级版,换用更强的 Gemma 4 12B 文本编码器与更高画质的 DiffVAE 解码器,并新增多镜头生成与 Diffusion Decoder 能力。
- 输入:Text + Image + Video
- 新特性:多镜头生成 · Diffusion Decoder
3. 推理性能对比
| 模型 | GPU | 推理步数 | 总耗时 | 平均单步 | 峰值显存 |
|---|---|---|---|---|---|
| MOVA | 1×H20 | 8 steps | 2min 40s | 20s/step | 71.7G |
| LTX-2.3 | 1×H20 | 8 + 2 (V2V) | 1min 16s | 7.6s/step | 80G |
| Bernini-S2V | 1×H20 | 4 steps | 1min 30s | 22.5s/step | 50G |
| MiniMax-H3 | 1×H20 | 50 steps | 13min 46s | 16.5s/step | 82G |
| MiniMax-H3 Turbo | 1×H20 | 4 steps | 1min 13s | 18.4s/step | 83G |
| MAGI-2 Preview | 8×H20 | 100 steps | 6min 57s | 4.17s/step | 63G |
| LTX-2.5 | 1×H20 | 8 (320²) + 3 (640²) | 20s | 1.82s/step | 80G |
关键结论
- 最快总耗时:LTX-2.5 以 20 秒遥遥领先(8+3 步、1.82s/step),是唯一进入半分钟内的模型,碾压第二名一个数量级;
- 最快单步:LTX-2.5 的 1.82s/step 第一,其次 MAGI-2 的 4.17s/step(靠 8 卡并行 + MoE 6B 激活);
- 最低显存:Bernini-S2V 仅需 50G,单卡轻松可跑,是显存最友好的选择;
- 部署门槛:除 MAGI-2(需 8×H20)外,其余 6 个模型均 1×H20 即可部署;
- 最长耗时:MiniMax-H3 需要 50 步,总耗时 13min 46s;其 Turbo 版砍到 4 步后降至 1min 13s,步数蒸馏对 H3 的收益十分明显。
4. 架构对比
| 维度 | MOVA | LTX-2.3 | Bernini-S2V | MiniMax-H3 | MAGI-2 | LTX-2.5 |
|---|---|---|---|---|---|---|
| 总参数 | 32B | 22B (DiT) | 14B (Dense) | 33B (Dense) | 114B (MoE) | 22B (DiT) |
| 激活参数 | 18B | 22B | 14B | 33B | ~6B | 22B |
| 统一音视频 | ✅ Bridge | ✅ 非对称双流 | ✅ Wan-S2V (Audio) | ✅ 单流 Omni | ✅ 单流 MoE | ✅ 双流 |
| 文本编码器 | UMT5 | Gemma 3 | UMT5 | Qwen3-VL-32B | Qwen3.5-27B | Gemma 4 12B |
| 位置编码 | Aligned RoPE | 3D+1D | SA-3D RoPE | 3D MM-RoPE | 3D RoPE | 3D RoPE |
| 推理框架 | DiffSynth | diffusers | DiffSynth | SGLang/ComfyUI | SGLang | diffusers/ComfyUI |
| 视频编辑 | ❌ | ❌ | ✅ 统一框架 | ❌ | ❌ | ❌ |
从架构维度可以看出几个趋势:
- 统一多模态是主流方向,六个模型都在不同层面实现了音视频统一建模,但实现路径差异很大:MOVA 用 Bridge 桥接双塔,H3 用单流 Omni,LTX 用非对称双流;
- 文本编码器全面转向大语言模型(Gemma、Qwen、UMT5),从专有小模型演进到通用 LLM 骨干;
- 视频编辑能力目前只有 Bernini-S2V 原生支持统一框架,是它的差异化优势;
- 推理框架呈现分化:轻量模型多用 diffusers/DiffSynth,重量级 MoE 模型则依赖 SGLang。
5. 效果对比(3 组典型场景)
同一 Prompt 下,7 路模型的输出对比(含 MiniMax-H3 Turbo)。每组视频均含音频,点击可播放。
场景 #0 — 樱花列车
女性角色白色连衣裙,乘坐小火车穿越樱花海
场景 #5 — 城市夜景
男性角色 + 企鹅,繁华城市夜景,红灯笼与节日灯光
场景 #10 — 溪流岸边
女性角色蓝白长裙,阳光斑驳的溪流岸边与野花
6. 数据来源
- MOVA — OpenMOSS, “MOVA: Towards Scalable and Synchronized Video–Audio Generation” (2026). github.com/OpenMOSS/MOVA
- MiniMax-H3 — MiniMax, “H3-Base: Omni-Modal Generative System”. huggingface.co/MiniMaxAI/MiniMax-H3
- MAGI-2 Preview — Sand.ai, “Magi-2 Preview: Scaling Video Generation with MoE”. sand.ai/blog/magi-2-preview
- LTX-2.3 / LTX-2.5 — Lightricks, “LTX-2: Efficient Joint Audio-Visual Foundation Model” (2026). huggingface.co/Lightricks/LTX-2
- Bernini-S2V — ByteDance, “Bernini: Latent Semantic Planning for Video Diffusion” (2026).
推理数据基于 H20 (96GB) GPU 实测,报告生成时间 2026-08。