# Qwen 发了五个音频模型，语音识别、合成和实时对话都更新了，还加了两个创作和理解的新模型

> 原标题：Qwen 发布 Qwen-Audio-3.1 全家桶，ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next

- 来源：AI HOT 精选
- 发布时间：2026-09-23T09:11:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58374
- 原文：https://x.com/Alibaba_Qwen/status/2102687258990026993

## 摘要

Qwen-Audio-3.1 这次一口气放出五个模型，把之前的语音识别（ASR）、语音合成（TTS）和实时对话（Realtime）都升了级，另外新加了 TTS-Next 和 ASR-Next，分别用来做音频创作和更深层的音频理解。Realtime 模型现在能随时被打断，检测到你情绪低落时还会放慢语速、用更共情的方式回话。价格砍得挺狠：TTS 降了约七成...

## 推荐理由

Qwen 语音全家桶一次更新五个模型，不是简单刷版本号。我会先打个折：正文没披露 ASR-Next 和 TTS-Next 的具体能力边界和评测数据，这点先别太激动。但 TTS 降价约七成、Realtime 支持情绪感知打断，都是可验证的硬信息，对从业者选型和成本估算有直接参考价值。

## 锐评

Qwen 这次把语音模型线铺得很全，从听、说到实时对话、再到音频创作和理解，五个模型一起发。最直接的好处是价格：TTS 降了约七成，Realtime 降了约八成五，ASR 最高降了九成五，对用量大的产品来说省得挺实在。Realtime 模型加了情绪感知，检测到用户情绪低落会放慢语速、用更共情的方式回话，这个设计在客服或陪伴类场景里可能有用，但实际体验要看延迟和打断的流畅度。

整篇公告没放任何基准测试分数、字错率或首字延迟，也没说这些模型在嘈杂环境或方言下的表现。价格降幅很大，但如果准确率和响应速度跟不上，便宜也没意义。另外 TTS-Next 和 ASR-Next 的定位偏创作和深层理解，正文只提了概念，没给具体能做什么的例子，这块还得等后续评测。
