# Stability AI 发布 Stability Audio 3.0，能生成超过 6 分钟的专业歌曲

> 原标题：Stability AI 推出音频模型 Stability Audio 3.0，可生成最长 6 分钟专业级歌曲

- 来源：AI HOT 精选
- 发布时间：2026-05-20T15:42:09.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/24582
- 原文：https://www.ithome.com/0/953/086.htm

## 摘要

Stability AI 发了四个新音频模型，最小的两个（4.59 亿参数）能在手机或电脑本地跑，生成两分钟以内的声音和音乐。中型（14 亿参数）和大型（27 亿参数）模型能把完整歌曲拉到 6 分 20 秒，比上一代翻了一倍多。小号和中号模型已经开源，大号模型只走 API 和付费托管，年收入超 100 万美元的公司必须买商业授权。训练数据来自华纳和环球...

## 推荐理由

我会先打个折：标题里的“专业级”正文没给出任何评判标准或盲测结果，这点先别太激动。能生成超过6分钟的音乐确实比多数短片段模型进了一步，4款规格也说明在考虑不同算力场景。但全文没披露训练数据是否含版权素材、生成内容的商用条款，也没给任何客观音质指标，所以只能算一次产品更新，离行业震动还差几口气。

## 锐评

这次更新最实在的地方是把模型分成了四个尺寸，最小的 4.59 亿参数能塞进手机和电脑本地跑，生成两分钟以内的声音，这对做音效或者短视频配乐的人来说门槛降了不少。中型和大型模型把单次生成时长拉到了 6 分 20 秒，比上一代翻了一倍多，算是补上了之前做不了完整歌曲的短板。小号和中号模型已经开源，大号模型只走 API 和付费托管，年收入超过 100 万美元的公司必须买商业授权，商业路径很清晰。

训练数据方面，文章提到用了华纳和环球的授权数据，这比早期靠抓取数据训练的做法在版权上安全很多。但整篇稿子没给出任何音频样本、用户评测或者客观指标，只说“据称可生成专业级音乐”。没有试听，就很难判断它说的“精准维持音乐结构与旋律基调”到底成色如何。另外，新招来的高管要带队做专业音乐人产品线，但具体功能一个字没提，目前只能当个预告看。
