豆包出了个音频生成模型,一条提示词能直接出多人对话、配乐和音效
豆包音频生成模型1.0发布,重新定义AI音频创作
火山引擎发了豆包音频生成模型 1.0,用文字或一段参考音频就能端到端生成目标音频。一条提示词里可以同时安排多个角色的对白、情绪语气、背景音乐和环境音,不用后期再去多轨混音。模型一次能生成 2 分钟音频,多次延长时角色音色能保持一致,还支持零样本输入,不用额外训练就能用。它把音色和风格的控制拆开了,也能让一个声音演多个角色。目前已经在火山方舟 API 邀...
推荐理由:豆包音频模型 1.0 是字节/火山引擎发的旗舰模型,国内大厂发布按政策对标美国实验室的发布。端到端多角色音频生成是个差异化能力,H、K、R 三个轴都踩中了。我会先打个折:正文没披露实际延迟、并发限制和生成失败率,也没给第三方评测,所以分数停在 78 不往上拉。