# Stability AI 发了新音频模型，最长能生成六分多钟的歌

> 原标题：Stability AI releases a new audio model that can create 6-minute songs

- 来源：TechCrunch · AI
- 发布时间：2026-05-20T15:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/24683
- 原文：https://techcrunch.com/2026/05/20/stability-ai-release-a-new-audio-model-that-can-create-six-minute-songs/

## 摘要

Stability AI 推出了 Stable Audio 3.0 系列，一共四个模型。最小的两个（4.59 亿参数）能在设备本地跑，生成两分钟的音乐或音效；中等（14 亿参数）和大杯（27 亿参数）模型则能生成 6 分 20 秒的完整曲子，比 2024 年的 2.0 版长了一倍多。小、中杯模型都开放权重，可以随便用和改。不过正文没提训练数据来源、生成...

## 推荐理由

我会先打个折：标题的 6 分钟和正文的 2 分钟对不上，正文没解释这个差距，所以别太激动。但端侧能跑出 2 分钟音轨这件事本身挺省钱，对做音频工具的人是个信号。整体算中等偏轻的产品更新，靠标题的钩子和端侧成本点撑到 featured 门槛。

## 锐评

Stability AI 这次把 Stable Audio 3.0 拆成了四个尺寸，思路很清晰：最小的两个模型（4.59 亿参数）能在手机或电脑本地跑，生成两分钟的音乐或音效，而且开放权重，可以随便用和改。中等（14 亿参数）和大杯（27 亿参数）模型则把生成时长拉到了 6 分 20 秒，比去年 2.0 版的两分多钟翻了一倍多，能直接出完整歌曲结构了。

不过文章有个关键缺口：完全没提这些模型用什么数据训练的。音乐生成模型最容易踩版权雷，如果 Stability AI 不公开训练数据来源和授权情况，商业使用风险就很高。另外，生成质量、风格控制精度、歌词对齐能力这些实际体验指标，正文也没给出任何测试结果或用户反馈。

总的来说，模型规格和开放程度看起来不错，尤其是小模型能离线跑这点对开发者友好。但在数据和实际效果这两块信息补上之前，建议先观望。
