跳到正文
Computing Life · Share · 鸭哥调研

Gemini Robotics 2 把感知和规划合进一个模型,但把动作控制单独留给了底层

Gemini Robotics 2 的架构逻辑:机器人的感知与规划正在走向合并

Google 在 2026 年 8 月发了 Gemini Robotics 2 系列,分三层:云端 ER 2 负责看懂画面和推理步骤,但只输出文字和函数调用,不直接控制电机;VLA 模型负责把指令变成动作;On-Device 2 直接跑在硬件上。这种拆分不是倒退,是物理世界逼的。大模型跑不了 200 Hz 的高频控制,小模型又塞不进通用常识。On-De...

推荐理由:这篇把 Google 刚发的 Gemini Robotics 2 架构拆得很明白,核心就一句话:云端负责看懂和想步骤,端侧负责把指令变成高频动作,这不是技术退步,是物理世界逼出来的分工。我会先打个折,因为机器人话题本身受众没大模型那么广,但文章用“200Hz 控制”“函数调用不碰电机”这些具体约束把道理讲透了,对从业者来说属于一看就懂的硬货,放在 featured 档 78 分是合适的。

读原文 ↗导出 Markdown