通义千问发布 Qwen-Audio-3.0-TTS,Flash 版主打实时交互,Plus 版走高质量路线,目前在 Artificial Analysis ...
通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜
阿里通义千问这次发了两个 TTS 版本:Flash 做实时交互,Plus 做高质量生成。模型支持用【whisper】、【angry】这类内联标签直接控制语气,也可以用自然语言描述想要的风格,覆盖 16 种语言,一次最多生成 3 分钟音频。目前它在 Artificial Analysis 的 TTS 排行榜上拿了第一。不过正文没披露参数量、具体延迟数据和...
推荐理由:阿里通义千问发了 Qwen-Audio-3.0-TTS,Flash 版做实时交互,Plus 版走高质量路线,用 [whisper] 这类标签直接控制语气,16 种语言、最长 3 分钟,目前在 Artificial Analysis 的 TTS 榜排第一。我会先打个折:正文没披露参数量、延迟数据和定价,这些是实际落地要看的硬指标。不过 Flash/Plus 的分层和语气标签机制本身有信息量,对做语音 agent 的人有参考价值,所以维持 78 分。