跳到正文
Hacker News 首页

苹果开源 LensVLM-9B:把长文档压成图片,只展开有用的那几页

LensVLM: Compressing long context as images, expanding only relevant pages

苹果在 Hugging Face 上放出了一个 9B 参数的视觉语言模型 LensVLM-9B。它的思路是把长文档先压缩成图片,需要时再按需展开相关页面,而不是一股脑把整本书塞进上下文窗口。目前只有模型卡,训练数据、跑分、压缩比这些关键信息都没披露,我会先打个折,等更多细节出来再看。

读原文 ↗导出 Markdown