MiniMax 官方发布的高性能音乐生成模型:输入歌词 + 音乐风格描述,直接生成最长 5 分钟、结构连贯完整的歌曲,输出 32kHz/16-bit 立体声 WAV。官方"整曲生成"新招牌:同时管住长程结构与帧级声学细节,月下载约 19,501 次、点赞 1.26k,且 diffusers 原生接入、一条命令起 API 服务,成为音乐生成类当期开源顶流。歌词直接决定演唱内容、风格描述控制编曲走向,创作者心智模型简单直观。

| 项目 | 内容 |
|---|---|
| HuggingFace 地址 | https://huggingface.co/MiniMaxAI/MiniMax-Music3 |
| 类型 | Model(文生音乐) |
| 热度分 trendingScore | 216(截至 2026-08-26) |
| 许可证 | 未标注名称(仓库含 LICENSE 文件链接) |
| 榜单 | HuggingFace 热榜 第13名 |
MiniMax 官方发布的高性能音乐生成模型:输入歌词 + 音乐风格描述,直接生成最长 5 分钟、结构连贯完整的歌曲,输出 32kHz/16-bit 立体声 WAV。
官方"整曲生成"新招牌:同时管住长程结构与帧级声学细节,月下载约 19,501 次、点赞 1.26k,且 diffusers 原生接入、一条命令起 API 服务,成为音乐生成类当期开源顶流。歌词直接决定演唱内容、风格描述控制编曲走向,创作者心智模型简单直观。
双 LLM 分层架构:Global LLM(8B,从 Qwen3-8B 初始化)逐帧预测第一个语义 RVQ 码本,负责长程结构;Local LLM(0.6B)补全帧内其余 7 个声学码本。隐藏态融合后经 Flow Matching(2.4B)与 Flow-VAE 解码路径渲染音频;8 层 RVQ tokenizer,音频帧率 25fps。限制:文本 prompt 上限 5000 token、音频上限 9000 帧。注意:Safetensors 元数据显示 2B 参数,与卡片描述的组件参数量存在出入,页面未解释。
from diffusers import ModularPipeline
pipe = ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-Music3")
pipe.load_components(dtype=torch.bfloat16)
audios = pipe(prompt="音乐描述", lyrics="歌词", audio_duration=60.0,
generator=torch.Generator("cuda").manual_seed(7), output="audios")
也可用 SGLang-Omni 起服务:`sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000`,POST `/v1/audio/speech`(input=歌词、instructions=音乐描述)。
权重以 bf16 分片分发,需 CUDA GPU;本地用 diffusers 脚本逐首生成,云端以 sgl-omni 包成 HTTP 服务供前端调用。未提供官方量化版本。
相对 Suno 等闭源产品是可私有部署的开源替代;对比 MusicGen(偏器乐短片段)、ACE-Step、YuE 等前代开源方案,本作把带人声的整曲时长推到 5 分钟量级并保持段落连贯,32kHz 立体声与 diffusers 官方管线支持让生态位更完整。
模型卡、仓库 LICENSE 文件、diffusers 安装 PR(页面附固定 commit)、SGLang-Omni 服务文档。