通义 Wan-Streamer v0.2 把听看说演塞进一个 Transformer,端到端延迟压到 550 毫秒
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms
通义实验室放出了 Wan-Streamer v0.2,一个把音频、视觉、语音和动作生成全塞进单个 Transformer 的模型。它从听到指令到给出画面和声音,端到端只花 550 毫秒,比上一代快了不少。输出分辨率从 v0.1 的 192×336 提到了 640×368,帧率 25FPS,画质明显上了一个台阶。架构上用了 Thinker-Perform...
推荐理由:通义实验室这个 Wan-Streamer v0.2 把多模态生成压进单模型,550ms 延迟和分辨率翻倍都是硬指标,H 和 K 直接到位。R 没给是因为正文没披露实际部署成本、具体应用案例或对比竞品的胜负手,对普通读者来说少了一个能转述的故事点。