# 通义千问发布 Qwen-Audio-3.0-TTS，Flash 版主打实时交互，Plus 版走高质量路线，目前在 Artificial Analysis ...

> 原标题：通义千问发布Qwen-Audio-3.0-TTS，登顶TTS排行榜

- 来源：AI HOT 精选
- 发布时间：2026-07-23T12:33:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46115
- 原文：https://x.com/Alibaba_Qwen/status/2080270065547809133

## 摘要

阿里通义千问这次发了两个 TTS 版本：Flash 做实时交互，Plus 做高质量生成。模型支持用【whisper】、【angry】这类内联标签直接控制语气，也可以用自然语言描述想要的风格，覆盖 16 种语言，一次最多生成 3 分钟音频。目前它在 Artificial Analysis 的 TTS 排行榜上拿了第一。不过正文没披露参数量、具体延迟数据和...

## 推荐理由

阿里通义千问发了 Qwen-Audio-3.0-TTS，Flash 版做实时交互，Plus 版走高质量路线，用 [whisper] 这类标签直接控制语气，16 种语言、最长 3 分钟，目前在 Artificial Analysis 的 TTS 榜排第一。我会先打个折：正文没披露参数量、延迟数据和定价，这些是实际落地要看的硬指标。不过 Flash/Plus 的分层和语气标签机制本身有信息量，对做语音 agent 的人有参考价值，所以维持 78 分。

## 锐评

通义千问这次发了两个 TTS 版本，Flash 主打实时交互，Plus 走高质量路线，思路很清晰：一个拼速度，一个拼音质。模型支持用【whisper】这类标签直接控制语气，也能用大白话描述想要的风格，覆盖 16 种语言，一次最多生成 3 分钟音频，实用性不错。它在 Artificial Analysis 的 TTS 排行榜上拿了第一，说明至少在某些评测维度上跑赢了现有方案。

但正文没披露参数量、具体延迟数据和定价，这三个信息直接决定它能不能落地。Flash 号称实时，但没给端到端延迟数字，是 200 毫秒还是 2 秒，体验差很多。Plus 的高质量也没说清楚比 Flash 好在哪，是采样率更高还是韵律更自然。另外，16 种语言的支持程度也不透明，是每种都达到可用水平，还是只有中英文打磨过。

如果是真的省钱又好用，这个模型对做语音助手、有声书、视频配音的团队会有吸引力。但没看到价格和延迟之前，只能先打个折。
