# 上海AI实验室把OpenClaw那套方法搬到了多模态生成上，6B小模型在部分任务跑赢了Nano Banana 2

> 原标题：OpenClaw的风刮到了多模态生成，6B小模型超越Nano Banana 2！

- 来源：量子位 · 公众号
- 发布时间：2026-04-11T01:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6299
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247882420&idx=3&sn=5936d709effbe79c7548aff579363380

## 摘要

上海AI实验室的团队搞了个叫GEMS的方法，给多模态生成模型加上了Agent循环、记忆和技能模块，相当于让模型在生成图片时能自己规划步骤、记住中间结果。他们用6B参数的Z-Image-Turbo做实验，在5个主流任务上平均提升14.22分，在4个下游任务上比之前最好的基线又高了8.92分，部分指标超过了Nano Banana 2。论文和代码都公开了，但...

## 推荐理由

这条的钩子很直接——6B 模型在多模态生成上叫板 Nano Banana 2。文章把做法讲清楚了：不是单纯换模型，而是把 agent 循环、记忆和技能模块塞进生成流程，相当于让模型边画边改、边查资料。给出的数字也具体，5 个任务平均涨 14.22，下游再涨 8.92，论文和代码都有，可以自己验。我会先打个折，因为正文没披露 Nano Banana 2 的完整对比设置，不知道对方有没有用同样的 agent 套路，所以不能直接当碾压局看。但方向本身值得关注，小模型靠推理时多跑几步来追大模型，这条路如果走通，部署成本会友好很多。

## 锐评

上海AI实验室给多模态生成模型装了一套“思考-记忆-动手”的流程，叫GEMS。简单说，就是让模型在画图前先规划步骤、记住中间结果，而不是一次性出图。他们在6B参数的Z-Image-Turbo上试了这招，5个主流任务平均提了14.22分，4个下游任务比之前最好的基线又高了8.92分，部分指标确实超过了Nano Banana 2。

不过得打个折。正文没写Nano Banana 2的参数量、训练数据、推理成本这些关键信息，所以这个“超越”到底是在同等条件下比的，还是小模型靠额外推理开销硬堆出来的，目前看不出来。论文和代码倒是公开了，但实际部署时Agent循环带来的延迟和计算开销，文章也没提。

如果这套方法真能在不显著增加成本的前提下让6B模型打平甚至超过更大的模型，那对做轻量化多模态应用的人是个好消息。但现阶段缺的是跟同量级模型的公平对比，以及推理效率的实测数据。
