跳到正文
Hacker News 首页

TIPSv2:Google DeepMind 给视觉语言模型换了套预训练配方,零样本分割涨了 14.1 分

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

Google DeepMind 发了 TIPSv2,一篇 CVPR 2026 论文,改了三处预训练方法,让视觉模型在零样本分割上明显变强。核心发现是:用蒸馏训练出来的小模型,在图像区域和文本的对齐能力上反而超过了大模型老师,原因在于老师模型在预训练时没管那些没被遮住的图像块。于是他们搞了个 iBOT++,把自监督学习的目标从只盯被遮住的块,扩展到所有图...

推荐理由:Google DeepMind 在 CVPR 2026 拿出的 TIPSv2,核心是三处预训练改动。最值得看的是 iBOT++:对遮挡和可见 patch 都加自蒸馏损失,零样本分割直接涨了 14.1 mIoU,同时用 Head-only EMA 把训练参数砍掉 42%。我会先打个折——这还是一次研究发布,不是当天就能用的模型,但可见 token 监督这个方向比堆大教师模型务实,对想省预训练成本的人是个信号。

读原文 ↗导出 Markdown