首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

MiniMaxAI/MiniMax-Music3

MiniMax 官方发布的高性能音乐生成模型:输入歌词 + 音乐风格描述,直接生成最长 5 分钟、结构连贯完整的歌曲,输出 32kHz/16-bit 立体声 WAV。官方"整曲生成"新招牌:同时管住长程结构与帧级声学细节,月下载约 19,501 次、点赞 1.26k,且 diffusers 原生接入、一条命令起 API 服务,成为音乐生成类当期开源顶流。歌词直接决定演唱内容、风格描述控制编曲走向,创作者心智模型简单直观。

类型
Model
热度分
216
下载量
19,501
Likes
1,255
许可证
未标注
在 HuggingFace 打开 回到总表

配图

信息卡

项目内容
HuggingFace 地址https://huggingface.co/MiniMaxAI/MiniMax-Music3
类型Model(文生音乐)
热度分 trendingScore216(截至 2026-08-26)
许可证未标注名称(仓库含 LICENSE 文件链接)
榜单HuggingFace 热榜 第13名

一句话定位

MiniMax 官方发布的高性能音乐生成模型:输入歌词 + 音乐风格描述,直接生成最长 5 分钟、结构连贯完整的歌曲,输出 32kHz/16-bit 立体声 WAV。

为什么上热度榜

官方"整曲生成"新招牌:同时管住长程结构与帧级声学细节,月下载约 19,501 次、点赞 1.26k,且 diffusers 原生接入、一条命令起 API 服务,成为音乐生成类当期开源顶流。歌词直接决定演唱内容、风格描述控制编曲走向,创作者心智模型简单直观。

规格与技术亮点

双 LLM 分层架构:Global LLM(8B,从 Qwen3-8B 初始化)逐帧预测第一个语义 RVQ 码本,负责长程结构;Local LLM(0.6B)补全帧内其余 7 个声学码本。隐藏态融合后经 Flow Matching(2.4B)与 Flow-VAE 解码路径渲染音频;8 层 RVQ tokenizer,音频帧率 25fps。限制:文本 prompt 上限 5000 token、音频上限 9000 帧。注意:Safetensors 元数据显示 2B 参数,与卡片描述的组件参数量存在出入,页面未解释。

使用方式与代码示例

from diffusers import ModularPipeline
pipe = ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-Music3")
pipe.load_components(dtype=torch.bfloat16)
audios = pipe(prompt="音乐描述", lyrics="歌词", audio_duration=60.0,
              generator=torch.Generator("cuda").manual_seed(7), output="audios")

也可用 SGLang-Omni 起服务:`sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000`,POST `/v1/audio/speech`(input=歌词、instructions=音乐描述)。

部署建议(本地/云端/量化选择)

权重以 bf16 分片分发,需 CUDA GPU;本地用 diffusers 脚本逐首生成,云端以 sgl-omni 包成 HTTP 服务供前端调用。未提供官方量化版本。

典型应用场景

同类对比

相对 Suno 等闭源产品是可私有部署的开源替代;对比 MusicGen(偏器乐短片段)、ACE-Step、YuE 等前代开源方案,本作把带人声的整曲时长推到 5 分钟量级并保持段落连贯,32kHz 立体声与 diffusers 官方管线支持让生态位更完整。

资源导航

模型卡、仓库 LICENSE 文件、diffusers 安装 PR(页面附固定 commit)、SGLang-Omni 服务文档。

← 上一篇JonathanColetti/Qwen3.8-27B-Uncensored-GGUF下一篇 →unsloth/Qwen3.8-Flash-Next-GGUF