新加坡国立等团队提出 ViF,专治多智能体协作时的视觉幻觉传染
多智能体系统里有个麻烦:一个模型看图说话出错,把错误描述传给下一个模型,下一个模型再添油加醋,幻觉就像滚雪球一样越滚越大。新加坡国立大学 LV-Lab 等团队搞了个叫 ViF 的方法,不改造模型本身,即插即用。核心思路是不再只传文字,而是把视觉信息打包成“视觉接力令牌”塞进对话流里,同时用分层注意力重分配让模型多看该看的地方。论文已被 ICLR 202...
推荐理由:这篇入选 ICLR 2026 的工作解决的是多智能体视觉问答里一个很实际的毛病:纯靠文字传递信息,幻觉会一个 agent 传一个 agent,越传越离谱。他们提出的 ViF 用视觉中继令牌和分层注意力重分配,把图像信息直接塞进通信链路,不改模型就能插进现有系统。我会先打个折——论文没披露实际部署的延迟和额外算力开销,这点先别太激动。但 8 个基准、4 种结构、10 款模型上的提升摆在那里,幻觉严重度平均砍掉三成以上,环形结构接近四成,对做多模态 agent 的人来说是个值得跟的方案。