# 通义实验室推出 Qwen-Audio-3.0-TTS，Plus 版在 Artificial Analysis 榜单排第一

> 原标题：通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

- 来源：AI HOT 精选
- 发布时间：2026-07-20T08:53:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45436
- 原文：https://mp.weixin.qq.com/s/INvrqTrWLMm2WCLIqhqTrg

## 摘要

通义实验室发了两个实时语音合成模型：Flash 版首包延迟压到 300 毫秒左右，平均词错率/字错率 3.87，适合要反应快的场景；Plus 版直接冲到 Artificial Analysis 榜单第一，说话人相似度做到 82.75，支持 16 种语言和 20 种中文方言。正文没提参数量、跑在什么硬件上，也没说 API 怎么收费，所以成本这块先别急着算。

## 推荐理由

通义实验室这次发了两个实时 TTS 模型，Flash 主打快，Plus 主打像，定位清楚。Flash 首包延迟 300 毫秒、词错率 3.87，Plus 说话人相似度 82.75 且多语言多方言，这些数字够硬，能直接指导选型。但正文没提参数量、跑在什么硬件上、API 怎么收费，成本完全没法算，所以分数先打个折。

## 锐评

通义实验室这次放出的Qwen-Audio-3.0-TTS分两档：Flash版主打快，首包延迟约300毫秒，平均词错率/字错率3.87，适合需要即时反馈的场景，比如语音助手或实时翻译。Plus版走质量路线，在Artificial Analysis榜单拿了第一，说话人相似度做到82.75，支持16种语言和20种中文方言，覆盖面挺广。

不过正文没披露模型参数量、跑在什么硬件上，也没说API怎么收费。这些信息直接决定实际部署成本和延迟是否稳定，现在只能看个热闹。另外，榜单第一是综合评分还是单项指标、对比了哪些模型，原文也没展开，这点先别太激动。

还缺的是：不同语言和方言下的延迟与错误率有没有明显波动，以及长文本合成时会不会掉质量。这些才是工程落地要盯的。
