Qwen 发了五个音频模型,语音识别、合成和实时对话都更新了,还加了两个创作和理解的新模型
Qwen 发布 Qwen-Audio-3.1 全家桶,ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next
Qwen-Audio-3.1 这次一口气放出五个模型,把之前的语音识别(ASR)、语音合成(TTS)和实时对话(Realtime)都升了级,另外新加了 TTS-Next 和 ASR-Next,分别用来做音频创作和更深层的音频理解。Realtime 模型现在能随时被打断,检测到你情绪低落时还会放慢语速、用更共情的方式回话。价格砍得挺狠:TTS 降了约七成...
推荐理由:Qwen 语音全家桶一次更新五个模型,不是简单刷版本号。我会先打个折:正文没披露 ASR-Next 和 TTS-Next 的具体能力边界和评测数据,这点先别太激动。但 TTS 降价约七成、Realtime 支持情绪感知打断,都是可验证的硬信息,对从业者选型和成本估算有直接参考价值。