字节跳动发布 Seed Audio 1.0,一个模型端到端生成对白、音效和环境声
字节跳动发布 Seed Audio 1.0 音频创作模型,统一建模人声与音效实现端到端影视级音频生成
Seed Audio 1.0 把语音、音效和环境声放在一个通用声学编码器里统一建模,不再需要分别生成再手动拼接。一条 prompt 就能编排角色台词、情绪和音效的进场时间,控制精度到 100 毫秒。它支持零样本声音克隆,给一段参考音频就能复刻音色,单次生成约 2 分钟,还能在保持音色一致的前提下继续延长。多语种覆盖 20 多种语言,同一音色在不同语言里...
推荐理由:Seed Audio 1.0 是字节跳动放出的统一音频生成模型,把语音、音效、环境声端到端搞定,时间线控制精度到 100 毫秒,属于国内大厂在音频生成领域的一次重要发布。目前信息仅来自官方博客,没有独立测试或头部用户反馈,所以重要性定在 82,先不冲太高。