# 豆包出了个音频生成模型，一条提示词能直接出多人对话、配乐和音效

> 原标题：豆包音频生成模型1.0发布，重新定义AI音频创作

- 来源：AI HOT 精选
- 发布时间：2026-06-23T05:41:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40041
- 原文：https://mp.weixin.qq.com/s/iL0uyUjOMUEfudeuDP6wQQ

## 摘要

火山引擎发了豆包音频生成模型 1.0，用文字或一段参考音频就能端到端生成目标音频。一条提示词里可以同时安排多个角色的对白、情绪语气、背景音乐和环境音，不用后期再去多轨混音。模型一次能生成 2 分钟音频，多次延长时角色音色能保持一致，还支持零样本输入，不用额外训练就能用。它把音色和风格的控制拆开了，也能让一个声音演多个角色。目前已经在火山方舟 API 邀...

## 推荐理由

豆包音频模型 1.0 是字节/火山引擎发的旗舰模型，国内大厂发布按政策对标美国实验室的发布。端到端多角色音频生成是个差异化能力，H、K、R 三个轴都踩中了。我会先打个折：正文没披露实际延迟、并发限制和生成失败率，也没给第三方评测，所以分数停在 78 不往上拉。

## 锐评

这条发布最值得看的是把音频生成的门槛打下来了。以前做一段带对白、音效、背景音乐的音频，得分别录音、找素材、多轨混音，现在写一段提示词就能端到端出成品，对短视频创作者来说省事不少。模型支持零样本输入，不用额外训练就能用，还拆开了音色和风格的控制，一个声音能演多个角色，这些设计思路是对的。

但正文没给任何客观评测数据。2分钟生成、多次延长保持音色一致，这些是官方说法，实际在多人对话、情绪切换频繁的场景下，角色会不会串音、背景音会不会压住对白，都没披露。目前只在火山方舟API邀测，个人用户给30分钟免费额度，样本量太小，还看不出真实水平。

我会先打个折。端到端音频生成在学术上不是新东西，难的是工程化后的一致性、可控性和成本。豆包这次把产品路径铺到了剪映、即梦、番茄，说明字节是认真要做创作者工具链的。但到底能不能用、好不好用，得等公开评测和更多用户反馈，现在下结论太早。
