NVIDIA 与SANA 发布MiniMax Sol-H3 加速方案:1.653 秒生成5 秒影片,比播放还快

NVIDIA 与SANA Sol-Engine 研究团队昨日(7)发表Sol-H3,一套针对MiniMax-H3 视频生成开源模型的端到端推理加速方案。在8 张NVIDIA B300 Blackwell 系统上,Sol-H3 产生5 秒1344×768 解析度附带立体声的视频,推理时间只要1.653 秒,比视频本身的播放时间还短。团队将此称为「比播放更快」(faster than playback)的目标,这也为即时生成与真正互动式AI 视频铺平了道路。

NVIDIA 与SANA 发布MiniMax Sol-H3 加速方案:1.653 秒生成5 秒视频,比播放还快

Sol-H3:从「快」到「比播放还快」

Sol-H3 由Enze Xie(谢恩泽)主导,融合了NVIDIA 的Sol Engine 视频推理优化框架与Sol-Attn 稀疏注意力技术,加上MiniMax 自身的四步蒸馏方案,形成一套完整的推理执行栈。团队与Reactor 平台合作,第一天即提供API 服务,程式码以Apache 2.0 授权发布。

🚀 Sol-H3: @MiniMax_AI H3 Video Generation Faster Than Playback 🤩

Five seconds of world. 1.653 seconds to infer.

We’re releasing Sol-H3, our fastest end-to-end MiniMax-H3 inference stack yet. On one 8× NVIDIA B300 Blackwell system, it generates five seconds of 1344×768 video… pic.twitter.com/WSHHEbgIJj

— Enze Xie (@xieenze_jr) September 7, 2026

数据会说话。 Base H3 原始版本生成一段5 秒视频需要18.250 秒,使用50 步DiT 前向传播。 Sol-H3 只用四步DiT 前向传播,同样在8× B300 上只需1.653 秒,加速11.04 倍。延长到10 秒与15 秒视频时,加速倍率进一步提升到13.57 倍与15.05 倍,时间分别为3.732 秒与6.612 秒。

Sol-H3 也展示在不同GPU 规模下的扩展能力。 4 张B300 的系统产生5 秒视频为2.918 秒、10 秒为6.993 秒、15 秒为12.542 秒,加速倍率落在12.11 到15.54 倍之间。即使缩减到单张B300,5 秒视频也只需13.745 秒,加速9.45 倍;10 秒为37.813 秒、15 秒为52.260 秒。所有测试均在1344×768、24 FPS、附带立体声的条件下进行,取三次运行中位数,已排除模型载入与编译暖机时间。这样的加速幅度让H3 朝向即时生成迈进了一大步。

技术组成:Sol Engine × Sol-Attn 完整堆叠

Sol-H3 融合多层推理执行栈的技术,层层叠加后得出最终的加速结果。 NVIDIA 的Sol Engine 先前在8× GB200 上已针对MiniMax-H3 实现3.95 倍加速,包含三根支柱:无损核心优化(融合RMS-AdaLN、QKNorm + RoPE、QKV 合并、GEMM + GELU 等操作,减少HBM 读写次数)、跨步快取(在中间去噪步骤重复使用先前步的残差,跳过不需要重新计算的步骤,单此项就从17.7 秒降至6.88 秒)、以及Sol-Attn 免训练稀疏注意力(让每一步只计算真正需要的注意力区块)。

NVIDIA 与SANA 发布MiniMax Sol-H3 加速方案:1.653 秒生成5 秒视频,比播放还快

Sol-H3 在这个基础上进一步加入四步蒸馏与B300 平台的INT8 QKV / FP8 输出通讯最佳化,将加速倍率从3.95 倍推向11 到15 倍的水准。团队强调,这是一份完整的生成设置档比较,Base H3 用50 步、Sol-H3 用4 步,涵盖文字编码、DiT 去噪与VAE 解码的完整流程。

关键优化的具体成效:

  • 动态稀疏注意力(Sol-Attn):不需重新训练,在推理时动态决定哪些注意力区块需要计算。设置时间从1.206 ms 降至0.285 ms,减少76.4%
  • 平行批次VAE 解码:解码时间从7.55 秒降至0.602 秒
  • 记忆体释放:合计每张GPU 释放约24 GB,让更大解析度或更长序列的生成成为可能

Sol-H3 使用Dense 注意力在1× B300 上,4× 与8× 则启用Sol-Attn 搭配INT8 QKV / FP8 输出传输。时间测量包含文字编码、DiT 去噪与视讯/音讯VAE 解码,模型载入、编译暖机与最终MP4 封装则排除在外。

H3 加速方案的竞争格局

Sol-H3 并非MiniMax-H3 生态系中唯一的加速方案,但它是目前B300 硬体上加速倍率最高的一组。 8 月底,fal.ai 发布了H3 Max,能在3 秒内生成5 秒768p 附带音讯的视频,主打快速部署与广泛可用性,已在MiniMax Design 平台上线。

vLLM-Omni 也在9 月初发表了MiniMax H3 的生产级部署方案,整合FastVideo 的四步FastH3,同样实现了比播放更快的生成速度。 vLLM 的文章提到,从系统层面全面优化文字编码、DiT 去噪与VAE 解码等完整堆叠,并强调了模组化可组合的设计理念。

从目前AI 视频生成市场的发展来看,H3 的生态正在快速成形,从vLLM 的生产级部署到fal 的快速API 方案,再到Sol-H3 的极致加速,不同团队在不同环节贡献了各自的优化方案。

Sol-H3 的定位在于结合Sol Engine 的自动化搜寻式优化流程与B300 的硬体加速能力,以4 步DiT 达到15 倍以上的加速倍率。根据Sol Engine 的文件,其「代理原生自动优化」流程平行搜寻核心融合、稀疏注意力与快取三大技术系列的最佳参数,再通过整合器找到最佳组合,整个流程只需数小时而非数周。对于需要快速部署H3 服务的团队来说,这样的效率差距非常可观。

开源授权与后续应用

Sol-H3 以Apache 2.0 授权发布。团队指出,任何MiniMax-H3 的少步骤LoRA 模型都可以直接接入同一套引擎,不需额外调整。程式码设计上以可部署性为目标。目前已在Reactor 平台上提供API,使用者可以直接通过Reactor 使用Sol-H3 加速的H3 模型。

从技术路线来看,Sol-H3 与其他加速方案最大的不同在于它完整覆盖了从核心优化、稀疏化到蒸馏的每一层。多数加速方案只着重在单一层面,例如只做蒸馏或只做注意力最佳化。 Sol Engine 的「代理原生自动优化」架构平行搜寻三大技术系列的最佳参数组合,再通过整合器找到全局最优解。这个流程从模型发布到可部署的加速方案只需数小时,而非传统的手动调校数周。对于需要快速部署H3 服务的团队来说,这样的效率差距非常可观。

结语

以1.653 秒生成5 秒视频,让推理时间短于视频播完所需的时间。这个「比播放更快」的成果打开了即时视频生成的可能性,当模型能在比播放更短的时间内产出下一段内容时,连续24 FPS 的即时生成就不再只是理论。下一步是让这些技术整合成真正可用的互动式视频系统,Sol-H3 已经跨过了第一道门槛。从H3 生态系这几个月的发展速度来看,即时生成AI 视频离实际应用比许多人预想的要近。从八月Sol Engine 的3.95 倍到现在Sol-H3 的15 倍,进步的速度相当惊人。

赞 (0)
摩榜哥摩榜哥

相关推荐

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注