苹果开源 LensVLM-9B:把长文档压成图片,只展开有用的那几页
LensVLM: Compressing long context as images, expanding only relevant pages
苹果在 Hugging Face 上放出了一个 9B 参数的视觉语言模型 LensVLM-9B。它的思路是把长文档先压缩成图片,需要时再按需展开相关页面,而不是一股脑把整本书塞进上下文窗口。目前只有模型卡,训练数据、跑分、压缩比这些关键信息都没披露,我会先打个折,等更多细节出来再看。