# 商汤开源 SenseNova-U1：不卷参数卷架构，把图像理解和生成塞进同一个模型

> 原标题：不卷参数卷架构，这个开源模型把图像理解和生成统一了

- 来源：量子位 · 公众号
- 发布时间：2026-04-28T12:56:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11836
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247887537&idx=1&sn=67703ab483decc9a6e33b26c07636b5e

## 摘要

商汤放出了两个开源模型 SenseNova-U1，一个 8B 参数，另一个是总参数量 38B 的 MoE 版本，都用了一套叫 NEO-unify 的架构。它砍掉了传统的视觉编码器和 VAE，直接处理像素，在单张 H100 或 H200 上大概 9 秒能生成一张 2048×2048 的图。核心卖点是图文交错推理，也就是模型能边看文字边看图、边想边出图。不...

## 推荐理由

我会先打个折：正文没给图文交错思维链的具体效果和长文字渲染的实测，32K 上下文和连续图文 beta 也还是限制，别当成熟方案用。但去掉 VE/VAE 的像素直出设计确实有意思，9 秒出 2048 图的成本听着挺省，开源出来对做多模态的团队是个可拆可改的底子。

## 锐评

商汤这次放出的SenseNova-U1，核心是把图像理解和生成塞进同一个架构里，不再分家。传统做法是视觉编码器管看、VAE管画，它直接砍掉这两层，让模型从像素层面统一处理，思路挺激进。8B和38B MoE两个版本都开源了，单张H100或H200上跑2048×2048的图大概9秒，速度不算慢。

卖点是图文交错推理——模型能边读文字边看图，边想边出图，这对需要多步视觉推理的场景有用。不过正文没披露训练数据规模和具体评测基准，只说32K上下文、长文渲染和beta版交错创作还有限制。这些缺口意味着实际落地效果还得自己测，别光看架构就上头。

我会先打个折：架构统一是好事，但开源不等于开箱即用。没看到跟DALL·E或Stable Diffusion的横向对比，也没说推理成本在批量场景下涨多少。如果你要做产品，等社区跑出真实反馈再跟。
