# Qwen 发布实时同传模型，延迟压到 2.3 秒，能分清谁在说话

> 原标题：Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型，LAAL 降至 2.3 秒

- 来源：AI HOT 精选
- 发布时间：2026-09-18T09:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57369
- 原文：https://qwen.ai/blog?id=qwen3.8-livetranslate

## 摘要

Qwen3.8-LiveTranslate 把同声传译的延迟从上一代的 2.8 秒降到了 2.3 秒。它用了一种叫“交错架构”的方法，把音频和文字编成一条流，让模型边听边译，已经翻译过的内容可以缓存复用，所以质量比上一代有明显提升。这个模型支持 60 种语言的语音输入，新增了三个实用能力：一是实时区分说话人，多人轮流发言时能标出每句话是谁说的，并且克隆...

## 推荐理由

Qwen这次把同传延迟从2.8秒砍到2.3秒，靠的是交错架构和缓存复用，不是单纯堆算力。新增的说话人区分、声音克隆和双语字幕让模型从“翻译”往“场景理解”迈了一步。正文只给了官方博客，没有第三方评测或实际部署数据，所以分数没往上拉。对需要低延迟翻译的场景，这模型确实实用，但效果还得等更多人跑过才知道。

## 锐评

这条发布最值得看的是延迟从 2.8 秒降到 2.3 秒，虽然只快了半秒，但在同传里体感差别明显。它用的“交错架构”说白了就是把音频和文字编成一条流，模型边听边译，已经翻过的内容可以缓存复用，所以质量比上一代好。这次还加了三个实用功能：实时区分说话人并克隆音色、双语同步显示、以及靠上下文消解歧义。在 Omnilingua-MSpeaker 多说话人长音频测试上，翻译忠实度、流畅度、简洁度和说话人分离错误率都超过了现有主流系统。

不过要冷静看几点。正文没披露模型参数量和推理成本，这对实际部署很关键。FLEURS 测试集覆盖 70 个语言方向，但那是公开朗读数据集，跟真实会议里抢话、口音、背景噪音的场景差距不小。说话人分离和声音克隆的稳定性在极端多人场景下也没给具体数据。API 已经上了阿里云 DashScope，但定价和并发限制都没提。如果你要做产品集成，建议先拿自己的业务音频跑一轮，别只看论文指标。
