# 浙大与阿里提出 MetaCompress：只看图片就能学会压缩 Token，多轮视觉问答压缩率 90% 且精度不掉

> 原标题：只看图片就能学会压缩Token！浙大&amp;阿里新框架多轮VQA压缩率90%，精度不掉｜CVPR 2026

- 来源：量子位 · 公众号
- 发布时间：2026-05-07T13:36:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16538
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247889236&idx=3&sn=c7df379968508005e66d604552a3e491

## 摘要

这篇 CVPR 2026 论文介绍了一个叫 MetaCompress 的框架，专门解决多轮视觉问答里图片 Token 太多、推理太贵的问题。它的做法是让模型只看输入图片，自己生成一张“压缩映射图”，直接决定哪些视觉 Token 该留、哪些该扔，不需要额外训练一个压缩网络。文章给出的核心数据是：能砍掉 90% 的视觉 Token，同时保持回答精度不降。还...

## 推荐理由

我会先打个折：正文说精度不掉，但没给出具体数值和基准对比，这点先别太激动。不过思路确实干净——不用文本引导，只靠图像自身信息决定哪些视觉 Token 可以扔，压缩率做到 90%，对多轮 VQA 这种反复调图的场景很实用。浙大和阿里联合出品，挂了 CVPR 2026，研究信号够强，不是产品通稿。开源了的话，做多模态推理优化的团队可以直接拉下来测延迟和显存变化。

## 锐评

这篇 CVPR 2026 论文的思路挺直接：多轮视觉问答里图片 Token 太多，推理又贵又慢。浙大和阿里的 MetaCompress 框架不额外训练压缩网络，而是让模型自己看图片生成一张“压缩映射图”，直接决定哪些视觉 Token 该留、哪些该扔。给出的数字是能砍掉 90% 的视觉 Token，精度不降，而且最优保留的 Token 和高注意力 Token 之间只有 1.71% 的重叠，说明模型不是简单按注意力高低来挑重点。

不过文章本身因为环境异常没抓到完整正文，具体在哪个数据集上测的、用了哪个基础模型、多轮对话轮次多少、延迟和显存实际省了多少，这些关键信息都没披露。1.71% 这个数字看起来漂亮，但如果只在单一场景下验证，换模型或换任务可能就没这么稳。另外“精度不掉”是跟什么基线比、误差范围多大，也需要看原文才能判断。

整体看，思路有价值，尤其对需要反复读图的长对话场景。但没看到完整实验设置前，我会先打个折，等论文公开后再看泛化性。
