跳到正文
AI HOT 精选

通义实验室推出 Qwen-Audio-3.0-TTS,Plus 版在 Artificial Analysis 榜单排第一

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发了两个实时语音合成模型:Flash 版首包延迟压到 300 毫秒左右,平均词错率/字错率 3.87,适合要反应快的场景;Plus 版直接冲到 Artificial Analysis 榜单第一,说话人相似度做到 82.75,支持 16 种语言和 20 种中文方言。正文没提参数量、跑在什么硬件上,也没说 API 怎么收费,所以成本这块先别急着算。

推荐理由:通义实验室这次发了两个实时 TTS 模型,Flash 主打快,Plus 主打像,定位清楚。Flash 首包延迟 300 毫秒、词错率 3.87,Plus 说话人相似度 82.75 且多语言多方言,这些数字够硬,能直接指导选型。但正文没提参数量、跑在什么硬件上、API 怎么收费,成本完全没法算,所以分数先打个折。

读原文 ↗导出 Markdown