一、H3 是什么?打破任务与模态边界的「通才」模型

2026 年 7 月 31 日,MiniMax 正式发布新一代通用多模态生成模型 H3。与市面上把文生图、图生视频、首尾帧、主体参考、风格参考、声音、音效、音乐等拆成一大堆「专家模型」的思路不同,H3 的立身之本是「通用」与「统一」——把过去被清晰划分的图像、视频、音频边界,全部揉进一个模型。用 MiniMax 的话说,这是一次「打破任务与模态之间边界」的尝试。

H3 能统一理解文本、图像、视频、音频四种模态混合构成的上下文,并一次推理输出到视频:画面与原生立体声同时生成,最高支持 2K 分辨率、最长 15 秒。官方强调,它在指令遵循、文字与品牌渲染、V2V 动作迁移上表现突出,首批瞄准广告、品牌、电商、产品设计、UI/UX、游戏等商业化场景。

MiniMax H3 官方发布图:下一代开放权重、通用多模态视频模型(水母意象 × 官方紫色视觉)
MiniMax H3 官方发布图:下一代开放权重、通用多模态视频模型(水母意象 × 官方紫色视觉)

二、一个模型,同时「看懂」四种模态

真正的创作,往往要把图像、音频、视频等不同模态的信息搅在一起理解。H3 的「上下文全模态表征」让创作者只需用一句话描述「上下文与目标视频之间的关系」,复杂的全模态理解与生成便交给模型自行完成。官方给出的演示提示词堪称典型——

「参考 Video 1 里的希区柯克式运镜,让 Image 2 中的角色开口唱歌,并让歌声与 Audio 3 的音轨一致。」——仅用一句话,H3 自行完成跨文本、图像、视频、音频的联合理解与生成。

这正对应 MiniMax 对创作者需求的新判断:用户越来越倾向于直接说人话、把创作意图讲清楚,而不是硬着头皮拼装一长串技术提示词。当多模态理解、指令遵循与复杂任务执行持续提升,视频模型正从「生成一段素材」走向「真正参与整个内容生产过程」。

三、四大核心技术,撑起 2K 原生立体声

H3 的架构哲学很朴素——「通用与泛化」,但把它做出来却极其复杂。官方透露,从 Hailuo 01、Hailuo 02 到 H3,每一代的构建复杂度都比上一代高约一个数量级。其核心由四项技术撑起:

  • Contextual Omni Representation(上下文全模态表征):统一不同模态的上下文表意,让「理解」与「生成」处在同一表征空间

  • H3-VAE:在架构效率上带来大幅提升,为高分辨率与长序列建模兜底

  • H3-Omni Transformer:为任务泛化而生的架构,统一多种生成任务与多种模态

  • In-Context Regeneration(上下文内重建):2K 输出不依赖传统超分模块,而是让基座模型在自己的低分辨率结果上做重建,复用已有生成能力并借用原始多模态上下文,把细小文字与细节真正「找回来」

尤其值得关注的是 In-Context Regeneration——传统超分只能靠猜去补回细节(比如细小的文字),H3 则通过基于原上下文的重建,把它真正恢复出来。

四、价格屠夫:2K 每秒约 0.8 元,不到主流三分之一

H3 最「出圈」的还是价格。官方给了明确口径:默认 2K 分辨率下,H3 的每秒价格不到主流模型的 1/3;768p 下,不到主流模型 720p 价格的一半。按 2K 约 0.8 元/秒估算,生成 15 秒高清带声视频只需约 12 元——有媒体干脆称它是「视频界的价格屠夫」。

MiniMax H3 价格对比:2K 不足同类 1/3,768P 不足同级一半(行业主流数值按官方口径折算)
MiniMax H3 价格对比:2K 不足同类 1/3,768P 不足同级一半(行业主流数值按官方口径折算)

分辨率

H3 每秒价格

行业主流参考

2K

约 0.80 元/秒

约 2.4 元/秒(约为 H3 的 3 倍)

768P / 720p

约 0.50 元/秒

约 1.0 元/秒(约为 H3 的 2 倍)

注:行业主流参考价由官方「不足 1/3」「不足 1/2」的口径折算而来,实际随市场产品与渠道浮动,具体以官方最新说明为准。

五、开源生态加速:从本地 Mac 到 ComfyUI,再到 MiniMax Design

8 月 3 日,MiniMax 兑现承诺,正式开放 H3 模型权重。官方强调,从 H3 设计的最早期开始,硬件兼容性就是关键考量之一——这为开源社区在更多 AI 硬件上落地铺平了路。开源带来的生态链反应相当迅速:

  • h3.c 推理引擎:被中文媒体称为「Redis 之父」的开源作者放出的 H3 专属本地推理引擎,斩获约 2.3k Star,普通 Mac 也能本地跑 H3(当前主要支持 H3-Base 768p 级生成路径,画布像素上限约 768×1344)

  • ComfyUI 本地部署:社区教程让「在自己电脑上跑 AI 视频」成为可能,不用再依赖云端积分

  • MiniMax Design 工作台(8 月 20 日):H3 开源后的首个官方 Harness,一款多模态创作 Agent 工作台,把 H3 的能力落地到「从想法到成片交付」的商业视频全流程

  • 天数智芯等国产算力接入:高质量国产算力让 H3 的商业级视频生成「开箱即用」

  • LibTV 等平台首批上线 H3:社区实测「效果约达同行八成、价格不到一半」

六、市场为何「用脚投票」?一周股价 +78%,ARR 破 8 亿美元

H3 不只写在论文里,更体现在资本与业绩上。MiniMax(00100.HK)披露的中期数据显示,这家公司正加速向「卖铲子」式的商业化转型:第二季度收入环比增长 81.8%,上半年收入超去年全年;B 端收入占比升至 80%;7 月 Token 消耗量已达到 1 月的 20 倍;8 月年度经常性收入(ARR)突破 8 亿美元,相较 2 月的 1.5 亿美元暴涨约 500%。

股价同样给出了最直接的反馈:7 月 31 日 H3 发布当日上涨 13.15%,8 月 3 日官宣开源当日上涨 7.20%,8 月 6 日又上涨 17.10%。截至 8 月 7 日,H3 发布后的累计涨幅已高达 78%。

关键节点

事件

市场反应

2026-07-31

MiniMax H3 正式发布

当日股价 +13.15%

2026-08-03

官宣开放 H3 模型权重

当日股价 +7.20%

2026-08-06

开源生态持续发酵

当日股价 +17.10%

截至 08-07

H3 发布后累计

股价累计大涨 78%

2026-08-26

中期业绩会:Q2 收入 +81.8%、ARR 破 8 亿美元、B 端占 80%

市场聚焦 B 端与 Agent 红利

MiniMax CEO 闫俊杰在中期业绩会后表示:下一阶段,MiniMax 与大模型行业的增长来源仍是模型能力的提升;更强的模型会带来更多新客户与新任务,更好的推理效率则让客户以可接受的成本扩大使用。他还透露,模型发布周期将显著缩短,市场可以期待 M3.1、M3 等更多新模型。

七、结语:AI 视频的下半场,拼的是「通用 + 性价比 + 生态」

MiniMax H3 的走红并非偶然。它恰好踩中了 AI 视频从「生成一段素材」走向「真正参与内容生产全流程」的转折点:用「一个模型看多种模态、干多种任务」换通用性,用「原生立体声 + 2K」换交付完整度,用「约 0.8 元/秒、3 日即开源」换生态与商业的双重爆发。

对创作者而言,门槛与成本在明显下降;对行业而言,通用模型 + 高性价比 + 开放生态正成为新一轮竞争的标配。当然也要理性看待:本地部署仍有门槛(h3.c 与 ComfyUI 等本地路径目前仍以 768p 级为主,官方最高 2K 能力尚未完全覆盖本地路径),API 调用与商业化使用需遵循官方授权与各平台规则。AI 视频的下半场,或许才刚刚开始。

— END —

如果这篇文章对你有帮助,欢迎分享给正在选择 AI 工具的朋友。