MiniMax 的通用全模态生成系统:统一理解文本/图像/视频/音频上下文,生成原生立体声视频的开源核心 H3-Base——33B 稠密单流 Transformer,复用 Qwen3-VL 作为理解骨干。(对应图片文件名为 MiniMaxAI_MiniMax-H3.png)。核心能力围绕三模块系统、核心模型、组件构成展开。

| 项目 | 内容 |
|---|---|
| HF 地址 | https://huggingface.co/MiniMaxAI/MiniMax-H3 |
| 类型 | 稠密 Transformer 音视频生成模型(H3-Omni-Transformer, 33B) |
| trendingScore | 252 |
| 许可证 | MiniMax H3 Community License(自定义社区许可) |
| 榜单 | HuggingFace 热榜第 10 名 |
MiniMax 的通用全模态生成系统:统一理解文本/图像/视频/音频上下文,生成原生立体声视频的开源核心 H3-Base——33B 稠密单流 Transformer,复用 Qwen3-VL 作为理解骨干。(对应图片文件名为 MiniMaxAI_MiniMax-H3.png)
海螺系列在 C 端视频生成早已口碑爆棚,H3 第一次把这套能力部分开源即引爆关注:月下载约 479 万、点赞 4.49K、100 个衍生 Spaces 的体量说明需求侧巨大;"直接拿 Qwen3-VL-32B 当编码器"的工程选择在技术社区引发热议;音频+视频联合潜空间生成依旧是稀罕能力。数据为采集时点信息。
推荐框架为 SGLang、vLLM、diffusers 与 ComfyUI。SGLang 四卡部署:
sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 \
--ulysses-degree 4 ... --model-variant fl2va # 或 ref2va
权重下载:`hf download MiniMaxAI/MiniMax-H3 --include "FL2VA/*" "Ref2VA/*"`;diffusers 用户由 `ModularPipeline.from_pretrained()` 自动拉取。页面顶部示例与正文存在出入,以正文推荐的 diffusers 文档加载或 SGLang/vLLM 部署为准。完整 2K 流程 = 本地 768p 生成 + 官方 API 组合。
开源的 H3-Base 全量 BF16 约 66GB 权重,实用起步配置为 4×80GB(配套 Ulysses 并行);创作者快速出片直接用 hailuoai.video / platform.minimax.io 的托管 API;追求 2K 成片必须搭配官方 Regenerate-2K 云端环节;社区已有 55 个量化版本可降低显存门槛,但音频保真建议避免过激进度量化。
带对白与环境音的短剧/广告成片生成;多参考素材驱动的角色一致性视频(Ref2VA);虚拟主播与口播内容的自动化生产;音视频联合的世界模拟研究基座。
对比 Lightricks LTX-2.5:LTX 长于多镜头叙事与本地轻量部署,MiniMax-H3 强在 omni 理解输入与原生立体声但核心链路部分闭源;对比 Wan 类纯视频模型:H3 的音频联合生成与指令编排是代差优势;对比自家海螺 API:本地版自由度高但上限止步 768p。以上为采集时点对比快照。
模型页 https://huggingface.co/MiniMaxAI/MiniMax-H3 · 托管平台 platform.minimax.io(全球)/ platform.minimaxi.com(中国)· 海螺 App hailuoai.video · diffusers ModularPipeline 文档