SenseNova-U1-8B-MoT 开源多模态架构引发讨论,去掉 VE 和 VAE 的单体设计是亮点还是噱头?
SenseNova-U1-8B-MoT (novel open source multimodal understanding + image generation model) seems like a bigger deal architecturally then it’s getting credit for
商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型,能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构,把传统多模态模型里常见的 VE(视觉编码器)和 VAE(变分自编码器)都去掉了,支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升,但帖子正文没给出...
推荐理由:HKR 三项都踩中了:架构钩子够具体,一个 8B 模型把理解和生成揉在一起,还砍掉了 VE/VAE;信息增量有,但缺实测分数和部署成本,所以分数压在 72–77 这个区间。我会先打个折,没看到跑分和许可就别急着全信,但方向值得盯。