# Gemini Robotics 2 把感知和规划合进一个模型，但把动作控制单独留给了底层

> 原标题：Gemini Robotics 2 的架构逻辑：机器人的感知与规划正在走向合并

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-09T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49733
- 原文：https://yage.ai/share/gemini-robotics-2-architecture-merge-20260809.html

## 摘要

Google 在 2026 年 8 月发了 Gemini Robotics 2 系列，分三层：云端 ER 2 负责看懂画面和推理步骤，但只输出文字和函数调用，不直接控制电机；VLA 模型负责把指令变成动作；On-Device 2 直接跑在硬件上。这种拆分不是倒退，是物理世界逼的。大模型跑不了 200 Hz 的高频控制，小模型又塞不进通用常识。On-De...

## 推荐理由

这篇把 Google 刚发的 Gemini Robotics 2 架构拆得很明白，核心就一句话：云端负责看懂和想步骤，端侧负责把指令变成高频动作，这不是技术退步，是物理世界逼出来的分工。我会先打个折，因为机器人话题本身受众没大模型那么广，但文章用“200Hz 控制”“函数调用不碰电机”这些具体约束把道理讲透了，对从业者来说属于一看就懂的硬货，放在 featured 档 78 分是合适的。

## 锐评

这篇文章最值得看的地方，是它把“为什么大模型不能直接控制电机”这个直觉上的困惑讲清楚了。核心矛盾在于频率：高层推理模型每秒只能处理1帧画面，而底层动作控制需要跑到200Hz甚至1kHz，现有算力下，一个模型没法两头兼顾。所以Google的方案是让云端ER 2当“调度指挥官”，看懂场景、输出文字指令和函数调用，把具体的关节角度和运动轨迹交给下层的VLA模型去执行。这种高低频分离，就像人的大脑皮层和小脑的分工，是物理约束下的务实选择。

文章里几个数字值得留意：On-Device 2模型在SO101本体上，每任务只用0.25到1.7小时的示范数据，成功率就从6.7%冲到了53.3%，说明小样本适配这条路走得通。但一碰到柔性操作就露怯——拧入灯泡只有36%，扫进簸箕32%，系垃圾袋44%，说明精密力控和软体接触依然是硬骨头。文章还提了一个挺有用的概念叫“本体接入税”，把接入新硬件的综合成本拆成了数据采集、模型微调、延迟适配和安全认证四块，这比单纯炫耀适配了多少种机械臂要实在得多。

不过文章也有明显的信息缺口：ER 2的推理延迟到底是多少？Gemini Robotics 2的控制频率是多少？这些直接影响工程落地的关键指标，正文都没披露。另外，所有测试数据都来自Google自己的实验室环境，生产级的可靠性和长时运行的稳定性还没验证。所以On-Device 2那个53.3%的成功率，可以先打个折看——从实验室到工厂流水线，中间还隔着大量边缘异常处理和物理安全认证的坑要填。
