# H公司开源NeoMME：一个不用独立视觉塔、直接处理图片和文字的多语言编码器

> 原标题：NeoMME: an efficient Multimodal-native and Multilingual Encoder

- 来源：Hugging Face 博客
- 发布时间：2026-09-03T13:13:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55234
- 原文：https://huggingface.co/blog/Hcompany/neomme

## 摘要

H公司放出了NeoMME，有2.6亿和8亿参数两个版本，主打多语言、多模态。它没走主流路线——不挂单独的视觉塔，也不接自回归语言模型，而是用一个双向Transformer同时吃进文字和原始图片块，从头训练，训练方式叫“掩码离散扩散”，可以理解成用猜被遮住的文字来学图片内容。微调后的NeoMME-Retriever能在一次前向计算里同时输出稠密向量和“后...
