作者王兆洋
微信 Geisterspiele

MiniMax H3 今日上线。

同一天,Seedance 2.5 也正式全量发布。

多年后回头看可能 2026 年 7 月 31 日会是一个非常有意思的日子。一个最领先视频模型朝着工业化场景更进一步,同时开源领域终于有了一个真正意义上的“全模态”统一模型,且能力无限逼近了闭源最强模型。

两者同样重要,不过从整个多模态模型技术发展节点来看,H3 可能是此刻更值得研究的那个。

因为如果对比语言模型走过的路,它有那么一丢丢 DeepSeek R1 开源时的意味:

OpenAI 的 o1 当时在技术路线上做出了新的范式,在其他语言模型能力有些停滞的时候,提前进入了新的 scale 阶段。而 DeepSeek 很快也找到同样的方法,并且决定把 R1 开源出来。最终让所有语言模型都能够更进一步,整个行业得以往前推进。

而在多模态的路线上,Seedance 2.0 的出现让视频模型从上一个阶段的整体能力放缓里解脱出来,但它同样是一个闭源模型——这意味着整个行业要快速跟上,也需要一个同样水平的开源模型出现。

MiniMax H3 这次扮演的就是这个角色。

在我们的实测中,它是一个和 Seedance 2.0 能打得有来有回的模型,同时在我的体感中,它的生成速度更快,价格上按照官方定价直接去对比也更低。

根据官方信息,更详细的开源技术报告会在之后发布。而此次随发布时透露的技术信息也已经足够吊人胃口。从这些信息来看,它事实上做了模型底层的大量重构,甚至已经不只是一个"视频生成模型"。更准确的描述可能是:

一个把全模态上下文能力拉满,用语言统一所有任务中间层,从而长出更泛化多模态能力的开源模型。

1

实测:处处给你“通用”的感觉

还是先看看它的表现。

我们先试了试它全模态上下文的能力,也就是把三种模态揉进同一个镜头。

MiniMax H3 官方介绍,它支持原生的多模态理解与生成,用户可以上传文字、图片、音频、视频等多种输入,也可以直接让 H3 生成缺失的那个模态。

我们上传了一段红辣椒乐队的动画作为参考视频,一张上海徐家汇美罗城的街景作为参考图片,让 H3 把两者融合。

H3 首先 get 到了原视频中人物在屏幕里的移动特点。更关键的是,美罗城那块屏幕并不是普通的平面屏,而是一块球状屏幕——H3 识别到了这一点,并让人物的运动遵循了球面的变形规律。

另外,我们上传的视频和图片都是没有声音的,H3 自动补齐了音频:快节奏的 BGM、屏幕闪烁的音效、人物进入球状屏幕时的音效。

可以看出来,在做这个任务的时候,它不是在“执行一个融合任务”,而是在理解一段由视频、图片和文字共同构成的上下文——谁提供了运动、谁提供了场景、场景的几何特性又该如何反过来约束运动。至于音频,它直接就不再是一个独立的步骤了。

然后是广义编辑能力。给视频里的人物配音,甚至改变他原本说过的话。这不只要求理解声音、保持人物音色,还要求理解视频、适配人物嘴形。

我们从网上找了一段范志毅的采访视频,直接用一句话的提示词让他换了个说法。

可以看到,无论是音色还是嘴形都还原得很好。而且 H3 知道该改的是画面里原有的那行字,而不是另外糊一个横幅上去。

以及我还试了试它导演级的指令跟随能力,重点考察运镜与打光。

我们写了一条很长、很细的提示词。灯光是视频里非常重要的要素,对整体质感的提升很大,但以往的测试往往会忽略它。我们设计了一个影棚场景,让光线连续变化。

烛光、硬光、彩虹折射、红蓝对打、金色逆光依次出现,过渡也比较平滑。

更惊喜的是,变化并非简单的画面调色:墙上的受光区域会跟着移动,人物面部的阴影会改变,金属球上的高光也会跟随光源变化。在红蓝灯光阶段,人物皮肤和白色真丝仍然保留了材质感,没有变成廉价的纯色剪影。提示词里要求的“最后半秒抬眼看向镜头”,执行得很准确。

1

它到底重构了什么

在这些测试的体验里,你能感觉到这个模型散发出的很多不同气质。而这些都来自 MiniMax 对模型的彻底重构。

和这家公司一直体现出来的技术追求一致,H3 的每个环节都在追求做出一个最有利于任务泛化的简洁架构。

简单来说,任何一个生成模型都可以粗暴地拆成四层:数据怎么被描述、信息怎么被压缩、算力怎么被组织、结果怎么被输出。H3 这次发布里提到的四个新工作,就对应这几个关键环节:Contextual Omni Representation 改变了最上游的数据与标注,在压缩的方式上提出了 H3-VAE ,而最主干的部分也有一个全新的 H3-Omni Transformer ,最终在输出层也用了新的思路,带来一个 In-context Regeneration 的新设计。

过去两年,视频生成的进步方式其实是高度一致的:

把某一类效果做好,封装成一个功能,接到产品上。于是我们看到的是一份不断变长的能力清单,用户在界面上先选模式,再填提示词。在模型侧,这些模式往往对应着不同的专家模型,或者至少是不同的一长串的各种 condition 分支。

MiniMax 把这形容为“任务、能力、模态的隔离”,这从根本上限制了使用上的自由度,也从训练范式上限定了模型的泛化能力。一个只在图生视频数据上训练的分支,学不到动作参考数据里的东西,反之亦然。数据被切碎在十几个任务里,能力也就泛化不了。

H3 的设计是,尽可能早地去掉任何“隔离”。

它先是把任务全部合并:给模型一段包含文字、图像、视频、音频的上下文,再用自然语言说清楚“上下文和目标之间是什么关系”,然后生成。当你操作这样一个任务:参考视频一的运镜、图二里的人、音频三的声音,生成视频,这时不再是三个开关,而是同一个任务里的不同信息。

这个思路对熟悉语言模型的人不会陌生。NLP 也曾经有几十个各自为政的任务,直到指令微调把它们统一成“一段自然语言指令加一段输入”。从那以后,任务不再是模型结构的一部分,而是数据的一部分。

但这样的思路下,对于多模态模型第一个挑战就是,如何知道“参考视频一的运镜”这句话对应哪一块信息?H3 给出的答案落在数据侧,也是 H3 里成本最高、最容易被外界略过的一环。

MiniMax 的官方资料称,训练 H3 过程中最重要的一件事是增加 caption 能力——但这里的 caption 已经不是通常意义上的“给视频配一段描述”。多模态上下文的引入让它被彻底泛化了:模型不止要描述目标视频,还要描述上下文与目标之间的关系,甚至是上下文内部各元素之间的关系;要联合描述视频和音频;而在多镜头场景下,音画之间的对应关系又更复杂一层。

MiniMax 给这套表征起了个名字:Contextual Omni Representation。其中用来解决这些可泛化的连结与解释的,毫不意外,就是语言。

MiniMax 的形容是:语言(或者说广义的智力结构)是泛化的桥梁。

过去的做法是把复杂性堆在模型结构里——每多一个任务,就多一个分支、多一套 condition 格式、多一份训练配比。H3 用语言把一切统一:所有的任务差异都变成描述上的差异,模型结构侧因此可以保持干净。过去结构里的复杂性不能泛化——你为"动作参考"设计的分支,帮不了"风格参考”。但语言里的复杂性可以:同一套表述能力,能描述一个训练里从没出现过的组合。

但这也带来了原本架构无法承受的复杂度量级。MiniMax 为此又彻底革新了前代的 tokenizer 。Tokenizer 的难点往往在于它是三个目标的角力:压缩率、重建质量,以及压出来的 latent 空间对生成主干友不友好。前两者天然矛盾,第三个最容易被忽略——压得越狠,latent 结构往往越不规则,主干反而更难学。

而据 MiniMax 的数据,这个名为 H3-VAE 的工作,拿到了 4 倍的序列长度收益。这也成了 H3 敢默认提供原生 2K ,并且做到“2K 每秒不到主流模型三分之一”的底气。

“架构技巧应为模型定义让路。”MiniMax 的文章中这样写道。

曾经在具体约束下有优势的 hailuo-02 架构,在一个追求泛化和通用的模型里就显得不合时宜,被它彻底替换。

一个模型团队主动“抛弃”自己曾经最引以为傲的架构,这在国内并不常见。但它和语言模型这几年反复上演的剧情是同一条逻辑:聪明的技巧总能在特定任务上取得成绩,而简洁的结构才可能在没见过的任务上成功。

一个面向任务泛化的架构诞生,H3-Omni Transformer。这是一个理解与生成异构的训练架构,精细调优不同 workload 下的硬件利用率,并联合考虑每样本异构计算×样本间的负载均衡,端到端提升了近 30%的训练吞吐。

在 MiniMax 的博客中,最值得细细品味的就是这一句:“任务泛化是不可逆转的趋势”。它在 H3 上的诸多工作都是从这个判断出发,做出的大胆尝试。

这些经验,甚至是踩过的各种的坑,在多模态模型领域已经很久没有人公开对外分享。闭源模型能走多远,只有它自己知道,而 H3 的权重放出来,技术方案开源后,它走过的这条路就成了所有人都可以验证、可以复用、也可以推翻的东西。

“长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。”MiniMax 的官方博客这样写道。而这样一个追上 Seedance 2 的开源模型,会推动整个多模态领域共同迈上一个台阶。

根据官方信息,MiniMax H3 视频生成价格为 0.8 元/秒(2K 分辨率),仅为业内同类旗舰视频模型的三分之一。在正式开源后,更多企业用户可以在本地灵活部署一款足够顶级的多模态模型,能结合自身数据和业务进行优化,更好地满足安全合规要求。而芯片厂商和开发者也能共同参与适配和优化,降低使用成本。这是多模态领域太久没有出现的选择了,现在它将提供给所有人。

多模态领域的格局看来是要变一变了。

**点个爱心**,再走 吧