# MOSS-VL：把实时互动当核心能力来做的开源视觉模型，边看边说

> 原标题：MOSS-VL技术报告：将实时交互作为一等能力的开源视觉语言模型家族

- 来源：AI HOT 精选
- 发布时间：2026-08-15T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51394
- 原文：https://arxiv.org/abs/2608.15045

## 摘要

复旦团队开源了一个叫 MOSS-VL 的视觉语言模型家族，最大的不同是它把“实时互动”——也就是模型一边接收画面一边说话——当作一等能力来设计。它用了一种叫门控交叉注意力的机制，把视觉信息放在解码序列外面处理，所以生成第一个字的延迟比同底座的 Qwen3-VL-8B 低了 2.8 到 5.1 倍，画面信息越多优势越明显。实时版 MOSS-VL-Real...

## 推荐理由

复旦开源了一个把实时交互当一等能力的视觉语言模型家族，不是事后加流式输出，而是从架构上就为低延迟设计。门控交叉注意力让视觉信息不进解码序列，首字延迟比 Qwen3-VL-8B 低 2.8 到 5.1 倍，帧数越多优势越大，这点对机器人、直播这类场景挺实在。我会先打个折：开源 VLM 现在不缺选手，MOSS-VL 的领先主要在工程实现上，报告里没看到它在通用多模态榜单上把同尺寸模型甩开，所以影响力偏垂直。H 和 K 都站得住，R 弱一些，整体给 featured 没问题。

## 锐评

复旦团队开源的MOSS-VL，核心卖点是把实时交互——也就是模型一边接收画面一边说话——当作一等能力来设计，而不是事后打补丁。它用了一种叫门控交叉注意力的机制，把视觉信息放在解码序列外面处理，所以生成第一个字的延迟比同底座的Qwen3-VL-8B低了2.8到5.1倍，视觉上下文越长优势越明显。实时版在四个流式基准里拿了三个第一，尤其在OmniMMI主动预警任务上，66.0分对最好基线的37.5分，差距拉得很开。

不过要注意，这篇是技术报告，不是经过同行评审的论文，所有数字都来自团队自报。正文没披露实时推理时的显存占用和吞吐量，也没说这套门控交叉注意力在长视频场景下会不会有注意力衰减的问题。11.3B的参数规模不算小，但视觉token不塞进解码序列，这个设计思路确实省了计算。

五个检查点、训练流程和推理代码全开源了，这点值得肯定。但实际部署效果还得等社区复现和第三方评测，现在看到的都是最优条件下的数据，先打个八折看。
