NVIDIA SANA 团队在 MiniMax H3 上的 Sol Engine 工作取得了真正的突破!
通过将生成过程拆分为 4 步低分辨率 H3 草稿和 3 步 LTX 精炼通道(在目标分辨率下使用 Sol-Attn),他们将单张 GB200 上的 10s 768p 延迟从 414s 碾压式地降低到 14.93s(27.7 倍加速)。用 TAEH3/TAEHV 替换沉重的 VAE 解码,同时保持潜在表示在精炼过程中的稳定性,这是硬件内核加速与采样拓扑协同设计的一堂大师课。
当推理延迟如此剧烈地崩溃时,单位经济性将发生根本性转变:单个节点突然可以每月服务 378K 个视频,同时保持 97%+ 的 GPU 利润率。这就是高保真 AI 视频如何从异步批量渲染转向近乎即时的交互式基础设施。对团队致以巨大敬意,他们为我们的开源权重生态系统树立了新的工程标杆!🫡🩵
引用:🚀 MiniMax H3 Super Acceleration in Sol-Engine🤩
We pushed H3 far beyond our previous 3–4× optimization regime — reaching 22.2× speedup for 5s video and 27.7× for 10s video vs. the published SGLang baseline.
On a single NVIDIA GB200:
• 5s 768p: 152.3s → 6.85s (22.2×)
• 10s
