# 谷歌和何恺明团队搞了个 Vision Banana，想把所有视觉任务统一成“生成像素”这一种操作

> 原标题：谷歌这把「香蕉」太狠了！何恺明等引爆视觉Transformer时刻

- 来源：新智元 · 公众号
- 发布时间：2026-04-24T06:31:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9683
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652694878&idx=2&sn=3007381ed6db675afbc20e3d41211733

## 摘要

Vision Banana 是谷歌 DeepMind 跟何恺明他们一起做的视觉模型，核心思路是用一套“像素生成”的界面去覆盖检测、分割、生成和编辑这些活，不再每种任务单独搞一个模型。文章里给了两组跟 Nano Banana Pro 的对比数据：在 GenAI-Bench 上人类偏好胜率 53.5%，在 ImgEdit 上胜率 47.8%，说明生成和编辑...

## 推荐理由

我会先打个折：训练数据规模和全量基准结果正文没披露，所以别急着对标完整模型。但真正值得盯的是接口变化——Google DeepMind 跟何恺明他们搞的这个 Vision Banana，把检测、分割、生成、编辑全统一成像素输出，不再往模型上挂一堆任务头。给的两组数字，GenAI-Bench 上对 Nano Banana Pro 人类评估胜率 53.5%，ImgEdit 上 47.8%，说明在生成和编辑任务上跟对手互有胜负，不是碾压。训练只提了混入少量可逆格式任务数据，具体配方没展开。对做多模态模型的团队来说，这个统一像素接口比具体分数更有嚼头，因为...

## 锐评

这条消息最值得关注的点是“一个界面覆盖所有视觉任务”，而不是模型叫 Banana 这种名字。谷歌 DeepMind 跟何恺明团队合作，想用像素生成的方式统一检测、分割、生成和编辑，不再每种任务单独训一个模型。文章里只给了两组跟 Nano Banana Pro 的对比：GenAI-Bench 上人类偏好胜率 53.5%，ImgEdit 上胜率 47.8%，说明生成和编辑能力跟对手互有胜负，没有碾压。

但问题在于，正文因为微信环境验证被屏蔽了，我们看不到技术细节。文章摘要提到只混了少量“可逆格式”的任务数据，那训练数据到底多大、覆盖多少任务类型、有没有在标准检测分割榜单上跑过分，这些全没披露。53.5% 的胜率看着还行，但如果只比了生成和编辑，那“统一视觉”这个说法就还没被验证。

我会先打个折：这更像一个概念验证，离真正一个模型通吃所有视觉任务还有距离。等论文或技术报告出来，看他们在 COCO、ADE20K 这些老牌榜单上的数字再说。
