MiniMax H3 的开放权重有多完整:33B 基座公开了,2K 质量链路还没有

MiniMax H3 的开放权重有多完整:33B 基座公开了,2K 质量链路还没有

MiniMax H3 公开 33B dense Omni Transformer 和本地 768p 工作流,但 Context-IR、2K regeneration 与首版稀疏注意力仍不在权重包里;本文拆开它的技术路线、部署边界与许可证条件。

MiniMax H3 这次公开的,是一条可以本地运行的 768p 基座路径,不是官方 2K 生成链路的完整开源版。Hugging Face 模型卡在北京时间 2026 年 8 月 3 日 14:20 显示最新更新,页面列出 33B dense H3-Omni-Transformer、两类本地 checkpoint 和完整 2K workflow;同一页面也明确写着,H3-Context-IR 不包含在开源发布中,H3-Regenerate-2K 尚未开源。1
这一区分决定了 H3 的真实定位:它给研究者和工程师一个相当完整的音视频生成底座,但官方演示中最影响复杂输入理解和 2K 输出的两段能力,仍通过托管服务提供。
MiniMax H3 的三模块系统流程图:Context-IR、H3-Base 和 H3-Regenerate-2K
官方模型卡把 H3 的路径画成三段:先把原始多模态指令整理成结构化上下文,再由 H3-Base 生成 768p 音视频,最后用原始上下文参与高分辨率再生。1

先把「开放」拆成三件事

把权重下载下来,并不等于官方系统的每一个模块都能在本地运行。H3 的公开边界可以按功能拆开:
模块负责什么初始发布状态对部署判断的影响
H3-Context-IR理解文本、图片、视频、音频之间的关系,把自由形式输入整理成结构化上下文官方实现不在开源包内;模型卡建议使用官方 API,或自行构建上下文处理系统复杂多模态参考的输入理解,不能直接按官方实现本地复现。1
H3-Base接收上下文与多模态潜变量,联合生成视频和音频提供 FL2VA 与 Ref2VA 两类本地 checkpoint,主要对应 768p 工作流这是本次开放权重最实在的增量,适合本地验证、二次开发和微调。1
H3-Regenerate-2K把 768p 结果和原始上下文重新送入模型,生成 2K 结果初始版本尚未开源;完整 2K 流程由本地 H3-Base 加官方 API 组成下载权重后不能单靠本地组件复现官方 2K 路径。1
因此,「开放权重」在这里更准确的含义是:核心生成底座和配套组件公开,而不是「端到端的官方质量链路全部公开」。这不是措辞上的小差异。Context-IR 改变了输入如何被解释,Regenerate-2K 改变了高分辨率细节如何被补回;缺失它们,会改变系统的可复现边界。

技术主线:先理解关系,再生成音视频

MiniMax 官方博客把 H3 的问题定义为:真实创作不是只给模型一句画面提示词,而是要同时表达文字、图片、参考视频、声音,以及这些材料之间的关系。例如,镜头运动来自一段视频,人物外观来自一张图片,演唱声音来自一段音频,模型要把三者关系落实到同一段输出里。2
H3-Context-IR 的作用,就是先处理这层关系。模型卡将它描述为包含指令解析、跨模态关联、时间理解和复杂逻辑推理的托管预处理系统,然后把结果序列化成 H3-Base 能接受的结构。官方还称,部分原始素材约有 10 万 token 的理解输入,经过专用流水线后平均压缩到约 4000 token;这是官方对其上下文处理流程的说明,不是对所有输入都成立的固定压缩率。12
H3-Base 再把不同模态编码成统一的 packed multimodal sequence。文本由 H3-Encoder 编码,视觉输入同时经过 H3-Encoder 和 H3-VisualVAE,音频则经过 H3-AudioVAE;统一序列随后送入 H3-Omni-Transformer,联合预测视频和音频潜变量。模型卡称,H3-Encoder 使用完整的 Qwen3-VL-32B 权重,并取其第 50 层 hidden states。1
这里有一个容易被标题带偏的地方:H3-Omni-Transformer 不是 MoE。官方模型卡把它定义为 33B 参数的 dense、single-stream Transformer,约 13B 参数位于 AdaLN 相关分支;模态差异主要放在输入输出层和 AdaLN 分支,主干仍是共享的 Transformer。模型卡还说,首个开放版本只提供 full attention 推理,稀疏注意力实现会在后续更新中发布。1
MiniMax H3-Base 的编码、统一序列、33B Omni Transformer 和音视频解码架构图
这张官方架构图展示了 H3-Base 的实际分工:文本、视觉和音频条件分别编码,进入同一个 33B dense 单流主干,最后同步解码为视频与立体声音频。1

2K 不是简单的超分辨率外挂

H3 的 2K 路径值得单独看,因为它解释了为什么「本地有权重」仍不能推出「本地有完整 2K」。
传统做法可以把低分辨率视频交给一个专门的超分模块,让它根据局部纹理猜高分辨率细节。MiniMax 的方案是让 H3 基座重新生成自己的低分辨率结果,同时再次读取原始多模态上下文。官方的解释是,这样既复用基座已有的生成能力,也能用原始上下文补回小字和细节,而不是只从低清结果猜测。12
这个设计有两个含义。
第一,2K 再生是生成流程的一部分,不是下载一个独立的放大器就能替代的后处理。第二,H3-Regenerate-2K 当前没有开源,官方推荐的完整验证方式是把本地 H3-Base 产生的结果交给 H3-Context-IR 与 H3-Regenerate-2K API。因而模型卡列出的「最高 2K」是系统能力规格,而不是首发权重包的单机能力规格。1

本地版本现在能做什么

模型卡提供两类任务专用 checkpoint:
  1. FL2VA:支持文本到音视频,以及首帧、尾帧或首尾帧到音视频。没有图片时是文生视频;提供一张或两张图片时,对应首帧、尾帧或首尾帧条件生成。
  2. Ref2VA:支持文本加多模态参考输入,可以放入图片、视频和音频,但音频不能单独作为输入。
Ref2VA 的输入边界也写得很具体:图片最多 9 张,视频最多 3 段,音频最多 3 段;视频和音频单类总时长不超过 15 秒,跨模态文件总数最多 12 个。输出为 4 至 15 秒、24 FPS,音频为 32 kHz 立体声;模型卡还列出阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语 11 种稳定支持的对话语言。1
这使 H3-Base 具备了一个可验证的本地工作面:开发者可以下载完整 checkpoint,用 SGLang、vLLM、diffusers 或 ComfyUI 尝试 768p 音视频生成,也可以围绕组件做进一步开发。模型卡的 SGLang 示例使用 4 张 GPU,应该读作官方部署示例,而不是所有硬件配置的最低门槛。1

官方数字应该怎样读

MiniMax 官方博客给出了几组很有吸引力的数字:2K 输出的每秒价格低于主流模型的三分之一,768p 输出的价格低于主流 720p 模型的一半;H3-Omni Transformer 的端到端训练吞吐提升近 30%;H3-VAE 的高压缩比带来 4 倍有效序列长度。2
这些数字可以帮助读者理解 MiniMax 的设计取舍,但不能直接变成「H3 已经全面领先」的结论。价格比较没有在页面上给出完整的对手名单、请求配置和统计口径;30% 是训练吞吐,不是用户端生成速度;4 倍有效序列长度是模型卡与博客对压缩设计的技术描述,也不等于所有长视频任务都会得到 4 倍吞吐。更稳妥的读法是:这些是 MiniMax 对成本和效率的自报主张,后续需要用公开权重、统一输入和真实硬件复测。

许可证让「开放」再多一层条件

H3 使用的不是 Apache 2.0 或 MIT,而是 MiniMax H3 Community License Agreement。许可证授予的权利是有范围的:Applicable Territory 定义为全球,但明确排除欧盟、英国、韩国和美国。换言之,不能把它写成「全球可直接部署」的模型。3
分发和商用也有额外条件:
  • 向第三方分发时,需要提供许可证文本;修改文件要带明显的修改说明,分发包还要附带指定的 NOTICE 文件。
  • 商业产品或服务年收入超过 2000 万美元,需要先向 MiniMax 取得书面授权;使用 H3 的商业产品界面还要显著显示「MiniMax H3」。
  • 产品、服务或托管服务需要执行许可证和可接受使用政策中的限制,包含地区、知识产权、安全防护和若干高风险用途限制。3
这不影响它作为开放权重发布的事实,但会影响谁能在什么地方、以什么方式把它放进产品。研究者下载和本地实验是一回事;向用户提供托管服务、在受限地区部署或把它并入高收入商业产品,是另一回事。具体项目仍需要在上线前核对许可证全文。

最后的判断:它是开放底座,不是完整开放产品

H3 的实质增量有两层。模型层面,MiniMax 公开了一个 33B dense 的全模态音视频生成底座,连同两类 checkpoint、视觉和音频 VAE、文本编码器以及本地 768p 验证路径。系统层面,它把 Context-IR、联合音视频生成和上下文再生 2K 串成一条更接近真实创作流程的链路。
但第二层链路并没有完整交给社区:Context-IR 仍是托管预处理系统,Regenerate-2K 尚未开源,首个开放版本也没有稀疏注意力实现;官方博客中的价格与效率数字目前仍属于厂商披露;许可证还排除四个主要地区,并为分发和大型商业产品设置条件。123
对不同读者,下一步也不同:工程师应先验证本地 H3-Base 的显存、吞吐、音视频同步和参考输入质量;产品团队要把 2K 视为本地基座加托管模块的混合路径,并同时核对 API 成本与许可地区;研究者最该等待的是完整技术报告、稀疏注意力实现、两个未开放模块的后续发布,以及独立复现结果。现在最准确的结论不是「H3 已经完全开源」,而是:MiniMax 把一个可运行的 33B 全模态生成底座开放了,但官方 2K 质量链路仍然只开放了一部分。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.