跳到正文
Hugging Face 博客

H公司开源NeoMME:一个不用独立视觉塔、直接处理图片和文字的多语言编码器

NeoMME: an efficient Multimodal-native and Multilingual Encoder

H公司放出了NeoMME,有2.6亿和8亿参数两个版本,主打多语言、多模态。它没走主流路线——不挂单独的视觉塔,也不接自回归语言模型,而是用一个双向Transformer同时吃进文字和原始图片块,从头训练,训练方式叫“掩码离散扩散”,可以理解成用猜被遮住的文字来学图片内容。微调后的NeoMME-Retriever能在一次前向计算里同时输出稠密向量和“后...

读原文 ↗导出 Markdown