# 新加坡国立等团队提出 ViF，专治多智能体协作时的视觉幻觉传染

> 原标题：终结多智能体视觉幻觉“滚雪球”！新国立等提出ViF：无需改造模型，即插即用

- 来源：量子位 · 公众号
- 发布时间：2026-04-30T04:37:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12458
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247887926&idx=3&sn=4678db70b1cb193a664e7acf6e1253ec

## 摘要

多智能体系统里有个麻烦：一个模型看图说话出错，把错误描述传给下一个模型，下一个模型再添油加醋，幻觉就像滚雪球一样越滚越大。新加坡国立大学 LV-Lab 等团队搞了个叫 ViF 的方法，不改造模型本身，即插即用。核心思路是不再只传文字，而是把视觉信息打包成“视觉接力令牌”塞进对话流里，同时用分层注意力重分配让模型多看该看的地方。论文已被 ICLR 202...

## 推荐理由

这篇入选 ICLR 2026 的工作解决的是多智能体视觉问答里一个很实际的毛病：纯靠文字传递信息，幻觉会一个 agent 传一个 agent，越传越离谱。他们提出的 ViF 用视觉中继令牌和分层注意力重分配，把图像信息直接塞进通信链路，不改模型就能插进现有系统。我会先打个折——论文没披露实际部署的延迟和额外算力开销，这点先别太激动。但 8 个基准、4 种结构、10 款模型上的提升摆在那里，幻觉严重度平均砍掉三成以上，环形结构接近四成，对做多模态 agent 的人来说是个值得跟的方案。

## 锐评

这条新闻讲的是多智能体系统里一个很实际的坑：一个模型看图认错了，把错误描述传给下一个，下一个再添油加醋，最后整个系统都在一本正经地胡说八道。新加坡国立大学 LV-Lab 他们提了个叫 ViF 的方法，不改造模型本身，即插即用。核心是把视觉信息打包成“视觉接力令牌”直接塞进智能体之间的对话里，再配合分层注意力重分配，让模型多看该看的地方。

论文被 ICLR 2026 收了，在 8 个基准、4 种多智能体结构、10 个视觉语言模型上测过，平均提升 2.4% 到 3.8%。幻觉率平均降了超过 30%，环形拓扑下能降近 40%。这些数字说明方法在不同设置下都有效，不是只在一个模型上刷分。

不过正文没披露具体是哪些基准和模型，也没说“视觉接力令牌”会多占多少上下文窗口、推理延迟增加多少。这点先别太激动——即插即用听起来省事，但实际部署时如果令牌太长把对话历史挤没了，或者每轮都重新算注意力导致响应变慢，工程上还得掂量。另外，降幻觉 30% 是相对值还是绝对值、在什么任务上测的，原文也没展开，我会先打个折看。
