# 高德发布全栈具身智能体系 ABot，号称在 15 项指标上拿了最优

> 原标题：横扫全球15项SOTA！高德首个面向AGI的全栈具身技术体系大公开

- 来源：量子位 · 公众号
- 发布时间：2026-04-19T04:28:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6514
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247884586&idx=1&sn=9bf96cc00105a72306c125f3513f7d07

## 摘要

高德这次公开的 ABot 是一套想让机器人真正干活的全栈技术体系，分视觉感知、物理世界模型和视觉语言动作模型几块。ABot-3DGS 能用厘米级地图数据重建上万平米的三维场景，ABot-PhysWorld 则是一个 140 亿参数的扩散模型，用 300 万条真实机械臂操作视频训练，让机器人先在大脑里模拟动作再执行。文章说横扫 15 项 SOTA，但具体...

## 推荐理由

高德这次公开的 ABot 体系，我会先打个折——15 项 SOTA 具体是哪些基准、跟谁比，正文没列，挑战赛名称也没给，这点先别太激动。但能聊的东西确实有：ABot-3DGS 拿厘米级地图和轨迹数据生成了上万组 3D 场景，号称覆盖率 99%，如果属实，等于用地图老本行给具身训练铺了一条低成本数据管道；ABot-PhysWorld 用 14B 的 DiT 加 300 万条真实操作视频做物理判别训练，规模不小。真正该盯的是他们把世界模型和 VLA 闭环绑在一起做的思路，不是单点炫技。开源范围和时间表都没披露，落地成色还得等。

## 锐评

高德这次拿出来的 ABot，是一套想让机器人从“看见”到“动手”的全栈方案，不是单一模型。视觉部分用厘米级地图数据重建上万平米三维场景，物理世界模型是个 140 亿参数的扩散模型，拿 300 万条真实机械臂操作视频训练，让机器人先在“脑内”模拟动作再执行。这个思路本身不新鲜，但把高精地图积累和操作数据揉在一起，确实有场景优势。

文章说横扫 15 项 SOTA，但没给任何具体榜单名称、指标数值或对比基线。300 万条操作视频听起来不少，可没说明任务多样性、场景覆盖和泛化验证到什么程度。140 亿参数的扩散模型推理延迟多高、能不能实时跑在端侧，正文也没提。

我会先打个折：技术路线有看点，但公开信息缺验证细节和开源计划，暂时只能当一次技术发布来看，离“真干活”还有距离。
