MiniMax H3 HuggingFace:开源下载、部署方式和真实边界
MiniMax H3 现在已经在 Hugging Face 开源。本文说明这次开放了哪些权重、如何下载、支持哪些工作流,以及 2K 全流程目前还依赖哪些 MiniMax API。
MiniMax H3 HuggingFace 现在已经上线
直接结论:MiniMax H3 已经在 Hugging Face 开源。 官方模型仓库是 MiniMaxAI/MiniMax-H3,开发者现在可以用下面的命令下载模型:
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3所以,搜索「MiniMax H3 HuggingFace」时,答案已经从「还要等」变成了「可以下载,但要理解它开放的范围」。截至 2026 年 8 月 3 日,更关键的问题不是模型卡有没有上线,而是:MiniMax 到底开源了哪些部分,本地能跑什么,哪些能力仍然需要官方 API。
MiniMax H3 HuggingFace 速览
| 问题 | 当前答案 |
|---|---|
| MiniMax H3 HuggingFace 上线了吗? | 上线了,官方仓库是 MiniMaxAI/MiniMax-H3。 |
| 可以下载权重吗? | 可以,使用 hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3。 |
| 这次开源了什么? | 两个 H3-Base 检查点:FL2VA 和 Ref2VA,并包含 processor、tokenizer、text encoder、transformer、visual VAE、audio VAE 等组件。 |
| 本地 H3-Base 能生成什么? | 768p 的带音频视频,支持文字到音频视频、首帧/尾帧到音频视频、参考素材到音频视频。 |
| 完整 2K 系统能纯本地跑吗? | 目前还不能。H3-Context-IR 和 H3-Regenerate-2K 在当前版本中仍依赖 MiniMax 官方 API 工作流。 |
| 使用什么许可证? | MiniMax H3 Community License Agreement。商业使用、再分发、微调前都应该先读许可证。 |
Part 1:这次 Hugging Face 到底开放了什么
MiniMax H3 是一个 omni-modal 视频生成系统,可以理解文字、图片、视频和音频组成的多模态上下文,并生成带原生立体声音频的视频。官方模型卡给出的规格包括:输出时长 4 到 15 秒,支持 16:9、1:1、3:4、9:16 等多种画幅,输出 24 FPS,音频为 32 kHz stereo。
这里最容易误解的一点是:MiniMax H3 不是一个单独的小模型文件,而是一套系统。完整 H3 系统分为三个主要模块:
- H3-Context-IR:托管的预处理和编排层,把自由形式的多模态输入整理成结构化的中间表示。
- H3-Base:本次开放的本地生成基础模型,生成 768p 的视频和音频。
- H3-Regenerate-2K:2K 再生成模块,会结合 768p 结果和原始上下文,补回高分辨率细节。
这次 Hugging Face 开源的核心是 H3-Base。MiniMax 发布了两个面向任务的 BF16 检查点:
| 检查点 | 支持任务 | 输入条件 | 输出 |
|---|---|---|---|
| MiniMax-H3 Base FL2VA | 文字到音频视频 t2va,首帧/尾帧到音频视频 fl2va | 文字,可选首帧、尾帧或两者同时输入 | 视频和音频 |
| MiniMax-H3 Base Ref2VA | 参考素材到音频视频 ref2va | 文字加参考图片、视频和/或音频 | 视频和音频 |
每个检查点都以 Hugging Face 风格的仓库结构分发,包含 model_index.json、processor、tokenizer、text_encoder、transformer、visual_vae 和 audio_vae。这说明 tokenizer 和配置文件本身就是 H3 工作流的一部分,不建议随意替换成通用 tokenizer。
哪些部分还没有完全开源?
MiniMax H3 HuggingFace 仓库是真实可下载的,但它不等于把 MiniMax 线上 2K 产品的完整管线全部搬到本地。
MiniMax 在模型卡里说明,H3-Context-IR 没有包含在这次开源发布中,原因是它依赖多阶段工作流和多个托管模型/服务。H3-Regenerate-2K 目前也还没有开源。如果要复现完整 2K 工作流,官方推荐的方式是:本地部署 H3-Base,再结合 MiniMax API 调用 Context-IR 和 Regenerate-2K。
所以更准确的判断是:本地 H3-Base 已经给开发者提供了可控的 768p 开源音视频生成路径;但最高质量的 2K 全流程,目前仍然是本地模型加官方 API 的混合方案。
Part 2:怎么使用 MiniMax H3 HuggingFace
第一步是下载官方仓库:
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3MiniMax 在模型卡里推荐了几类使用方式,包括 SGLang、vLLM、Diffusers 和 ComfyUI。如果你做后端服务,SGLang 示例最直接,可以分别启动 FL2VA 和 Ref2VA 两个变体:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2vasglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30011 \
--model-variant ref2va如果你是创作者,ComfyUI 会更友好;如果你是产品团队,SGLang 或 vLLM 更适合放进服务端队列、监控和调用链里。
该选哪条工作流?
| 目标 | 推荐路径 | 原因 |
|---|---|---|
| 快速看效果 | Hailuo AI 或 MiniMax H3 AI Video Generator | 不需要配置 GPU,适合先比较提示词和画面风格。 |
| 本地 768p 生成 | Hugging Face H3-Base | 可以直接控制开源权重,减少基础输出对 API 的依赖。 |
| 2K 验证 | 本地 H3-Base 加 MiniMax API | 当前 2K regenerate 阶段仍然依赖官方 API。 |
| 产品集成 | SGLang、vLLM 或第三方 API | 更适合后端稳定调用、排队和日志监控。 |
| 节点式创作 | ComfyUI 模板 | 对创作者更直观,不需要先写服务端代码。 |
MiniMax H3 最适合做什么?
MiniMax H3 的价值不只是「生成一段好看的视频」,而是「生成或编辑一段可用于品牌、产品和社媒的短视频,并且视频和声音一起生成」。这次开源尤其适合下面这些方向:
- 产品视频和电商展示
- 社媒广告和动态海报
- Logo、标题字和包装动效
- 首帧/尾帧控制的图片转视频
- 基于参考素材的人物、风格或动作迁移
- 需要声音和画面同步生成的短片测试
原生音频是一个关键差异。很多 AI 视频流程仍然把声音当成后期步骤:先生成视频,再配音效、对白或音乐。H3 的架构里包含独立 audio VAE,并把立体声音频作为输出的一部分,这对广告短片、音乐视频概念片和社媒内容测试很有价值。
开始投入前要注意什么?
第一,本地 H3-Base 目前主要是 768p 工作流。如果你的产品承诺是「原生 2K 输出」,现在仍然需要官方 API 参与完整 2K 流程。
第二,硬件门槛不低。官方 SGLang 示例使用多 GPU 参数。社区工具之后可能会降低部署难度,但这不是一个可以轻松塞进普通轻薄本的小模型。
第三,许可证要认真看。MiniMax H3 使用 MiniMax H3 Community License Agreement,不是通用的 MIT 或 Apache 许可证。商业化、再分发、微调和内容限制都应该在上线前确认。
Part 3:结论与 MiniMax H3 HuggingFace FAQ
MiniMax H3 在 Hugging Face 开源,是 2026 年 AI 视频领域很重要的一次开放权重发布。它让开发者不必把所有实验都放在封闭网页或纯 API 里,而是可以直接研究、部署和集成一个带原生音频的视频生成基础模型。
但这次发布也必须说清楚边界。MiniMax 没有在第一天把完整线上 H3 系统的所有模块都本地化开放。H3-Base 已经开放;H3-Context-IR 和 H3-Regenerate-2K 目前仍是 API 支持的工作流。 对开发者来说,这不是坏事,但需要在架构设计和成本预估里提前考虑。
简单建议如下:
| 用户类型 | 建议 |
|---|---|
| 只想测试提示词的创作者 | 先用 Hailuo AI 或 MiniMax H3 AI Video Generator。 |
| 想评估开源权重的开发者 | 下载 MiniMaxAI/MiniMax-H3,先从 FL2VA 检查点开始。 |
| 需要 2K 生产测试的团队 | 暂时使用 MiniMax 官方 API 混合工作流。 |
| 研究者或基础设施工程师 | 重点研究 H3-Base 架构、VAE 拆分、tokenizer 要求和 serving recipe。 |
FAQ
MiniMax H3 现在上 Hugging Face 了吗?
上了。官方仓库是 MiniMaxAI/MiniMax-H3。
MiniMax H3 权重怎么下载?
使用 Hugging Face CLI:
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3MiniMax H3 是完全开源了吗?
H3-Base 检查点已经在 Hugging Face 开源。当前发布不包含完整托管系统,H3-Context-IR 和 H3-Regenerate-2K 仍依赖 MiniMax API 工作流。
本地能跑什么分辨率?
当前本地 H3-Base 工作流面向 768p 生成。完整 2K 工作流目前需要本地 H3-Base 加 MiniMax API。
开放的检查点支持哪些任务?
FL2VA 支持文字到音频视频,以及首帧、尾帧、首尾帧到音频视频。Ref2VA 支持参考素材到音频视频,可以结合文字、参考图片、视频和/或音频。
MiniMax H3 会生成音频吗?
会。H3 生成的是带原生立体声音频的视频,官方规格写明音频输出为 32 kHz stereo。
可以用 ComfyUI 跑 MiniMax H3 吗?
可以。官方模型卡链接了 ComfyUI 资源和模板。对不想写 serving 代码的创作者来说,这是更容易上手的方式。
MiniMax H3 比 Seedance 2.5 或 Veo 更好吗?
要看任务。H3 更适合开源权重控制、本地实验、参考素材驱动的视频生成,以及音画一起生成的短视频工作流。Seedance、Veo、Kling 这类闭源模型在某些电影感、长时长或高分辨率生产任务上仍可能更强。
总结
MiniMax H3 HuggingFace 已经上线,旧问题的答案已经改变:开发者不再需要等模型卡出现,可以直接下载官方仓库,选择 FL2VA 或 Ref2VA,从 H3-Base 开始测试。
但要记住系统边界。如果你要完全本地的 2K,需要等 MiniMax 后续开放 H3-Regenerate-2K;如果你今天就要 2K 结果,就使用官方 API 混合工作流;如果只是想快速看在线效果,可以先试 MiniMax H3 AI Video Generator,再决定是否投入 GPU 部署。
MiniMax H3 HuggingFace 来源说明
- 官方 MiniMax H3 Hugging Face 模型卡:MiniMaxAI/MiniMax-H3
- 本文事实核对时间:2026 年 8 月 3 日。已核对模型卡上线、MiniMax H3 Community License Agreement、FL2VA 与 Ref2VA 检查点、H3-Base 本地部署说明,以及 2K 混合工作流说明。
- 模型卡提供的 MiniMax 平台入口:Global API、CN API、Global WebApp、CN WebApp。
Newsletter
Join the community
Subscribe to our newsletter for the latest news and updates