# 通义 Wan-Streamer v0.2 把听看说演塞进一个 Transformer，端到端延迟压到 550 毫秒

> 原标题：通义实验室发布 Wan-Streamer v0.2，端到端响应延迟仅 550ms

- 来源：AI HOT 精选
- 发布时间：2026-07-17T07:14:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44929
- 原文：https://mp.weixin.qq.com/s/_eaO0wmsiQFGsrE2_zW_Dg

## 摘要

通义实验室放出了 Wan-Streamer v0.2，一个把音频、视觉、语音和动作生成全塞进单个 Transformer 的模型。它从听到指令到给出画面和声音，端到端只花 550 毫秒，比上一代快了不少。输出分辨率从 v0.1 的 192×336 提到了 640×368，帧率 25FPS，画质明显上了一个台阶。架构上用了 Thinker-Perform...

## 推荐理由

通义实验室这个 Wan-Streamer v0.2 把多模态生成压进单模型，550ms 延迟和分辨率翻倍都是硬指标，H 和 K 直接到位。R 没给是因为正文没披露实际部署成本、具体应用案例或对比竞品的胜负手，对普通读者来说少了一个能转述的故事点。

## 锐评

Wan-Streamer v0.2 把音频、视觉、语音和动作生成全塞进一个 Transformer，端到端响应只花 550 毫秒，比上一代快了不少。输出分辨率从 192×336 提到 640×368，帧率 25FPS，画质确实上了一个台阶。架构上用了 Thinker-Performer 双通路，一边负责想、一边负责演，试图在质量和速度之间找平衡。

不过正文没披露参数量、训练数据规模和具体发布时间，这些信息直接决定模型能不能跑在消费级硬件上、以及实际部署成本。550ms 的延迟数字看着漂亮，但没说明是在什么硬件、什么并发条件下测的。如果是真的挺省钱，那对实时交互场景是个好消息；如果只是实验室理想环境跑出来的，就得先打个折。

还缺的是多轮对话稳定性、长视频生成质量，以及跟其他全模态模型的横向对比。这些不补上，很难判断它到底是个工程优化还是架构突破。
