# SenseNova-U1-8B-MoT 开源多模态架构引发讨论，去掉 VE 和 VAE 的单体设计是亮点还是噱头？

> 原标题：SenseNova-U1-8B-MoT (novel open source multimodal understanding + image generation model) seems like a bigger deal architecturally then it’s getting credit for

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T15:02:15.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14450
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t4i1yx/sensenovau18bmot_novel_open_source_multimodal/

## 摘要

商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型，能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构，把传统多模态模型里常见的 VE（视觉编码器）和 VAE（变分自编码器）都去掉了，支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升，但帖子正文没给出...

## 推荐理由

HKR 三项都踩中了：架构钩子够具体，一个 8B 模型把理解和生成揉在一起，还砍掉了 VE/VAE；信息增量有，但缺实测分数和部署成本，所以分数压在 72–77 这个区间。我会先打个折，没看到跑分和许可就别急着全信，但方向值得盯。

## 锐评

商汤开源的SenseNova-U1-8B-MoT是个8B参数的多模态模型，能看图说话也能直接出图。它最狠的一刀是把传统多模态模型里标配的视觉编码器和变分自编码器全拿掉了，换成一套叫NEO-Unify的单体架构。这意味着模型不再需要先把图片压缩成潜空间向量再解码，而是原生处理图文交错任务，理论上能省下不少推理延迟和显存开销。Reddit原帖讨论热度不低，但正文没给出任何基准测试分数，也没说高密度渲染具体指什么场景、效果对比谁。我会先打个折：架构创新值得关注，但没跑分就没法判断这8B是真能打还是只省了组件。另外帖子本身被Reddit安全策略挡了，信息全来自Hugging Face页面和讨论摘要，训练数据、推理速度、显存占用这些关键指标都缺。如果后续有第三方评测能复现它的图文生成质量，这个去掉VE和VAE的思路对端侧部署会挺省钱。
