# MiniMax 发布 Music 3.0：开源权重的音乐模型，一次生成一首完整的 5 分钟歌曲

> 原标题：MiniMax Music 3.0 发布：新一代开源权重、生产级全能音乐模型

- 来源：AI HOT 精选
- 发布时间：2026-08-13T16:52:23.676Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50493
- 原文：https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model

## 摘要

MiniMax 今天放出了 Music 3.0，一个开源权重的音乐生成模型。你给它一个创意方向和可选的歌词，它就能一次性把编曲、演奏和人声全搞定，最长能到 5 分钟。这次升级主要想解决三个老问题：准确理解你想表达什么、把这种感觉撑满整首歌、让人声和乐器听起来像真人实录而不是机器合成的。技术上换了一套新架构，叫 Hybrid-LM，用一个 80 亿参数的...

## 推荐理由

MiniMax 这次把 Music 3.0 开源权重放出来，一次生成最长 5 分钟的带人声完整歌曲，直接对标 Suno/Udio。我会先打个折：正文没披露训练数据规模和具体推理延迟，但公开的 Hybrid-LM 架构和 80 亿参数已经比多数闭源模型透明，对想自己部署和调参的团队来说，上手门槛低了不少。

## 锐评

MiniMax 这次放出的 Music 3.0，核心卖点是“一次性生成完整歌曲”，最长能到 5 分钟。它想解决三个老问题：准确理解你的创作意图、把这种感觉撑满整首歌、让人声和乐器听起来像真人实录。技术上换了一套叫 Hybrid-LM 的新架构，用一个 80 亿参数的大模型管整首歌的结构，再用一个 6 亿参数的小模型去抠每一帧的声学细节，最后通过流匹配和 Flow-VAE 把离散预测转成连续音频。这个思路有点像给音乐生成配了个总指挥加一群演奏员，分工明确。

不过，这篇官方博客没给出任何定量对比。正文没披露训练数据规模、生成一首 5 分钟的歌要等多久、开源用的是哪个具体许可证，也没有跟 Suno 或 Udio 等竞品的跑分对比。所以“生产级”这个说法，目前只能看作 MiniMax 自己的目标，外部还没法验证。另外，它提到用 Qwen3.5-8B 来做音乐描述的结构化改写，这是个挺实际的工程选择，但最终效果强依赖描述的质量。

还缺什么：最关键的还是人听的评测结果和延迟数据。如果生成一首歌要几分钟，那离“生产级”就还有距离。开源权重是好事，但许可证如果不明确，商业使用会有风险。建议等社区有人跑起来、放出实测音频和速度数据后，再判断它到底有多能打。
