跳到正文

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 61–80 条 · 共 167 条

6月1日星期一

机器之心 · 公众号

OpenAI 为机器人团队招兵买马,由 Sora 负责人带队,部分岗位底薪开到 34 万美元以上

OpenAI 放出了十多个旧金山的机器人岗位,团队由 Sora 的负责人 Aditya Ramesh 带队,是从他之前的 Worldsim 项目演变过来的。其中执行器设计工程师的底薪现金在 34.2 万到 44.5 万美元之间,另外还有 PPU 激励。不过原文因为微信环境异常,具体岗位职责和团队规模都没披露,只能看到招聘信息的大致框架。

推荐理由:这条消息有明确的团队、负责人和薪资数字,不是模型或产品发布,但作为招聘信号已经够硬。我会先打个折:目前只是招人阶段,离实际产品还有距离,这点先别太激动。不过 OpenAI 把机器人当成全栈方向来做,薪酬又直接对标顶级硬件人才,对同行抢人和行业风向都有参考价值,所以放在 featured 档位没问题。

机器之心 · 公众号

VAST 发布 Project Eden,世界模型第一次能像游戏一样“存档”了

VAST 推出了一个叫 Project Eden 的三层世界模型架构,把场景的持久状态和画面渲染拆开了。简单说,就是给 AI 生成的 3D 世界加了个“存档”功能,你改过的东西下次打开还在,不用每次都重新生成。文章还提到 VAST 在 A+ 和 A++ 轮一共融了将近 2 亿美元。不过正文因为微信页面环境异常被屏蔽了,具体技术细节和效果演示都没看到,这...

推荐理由:我会先打个折:VAST 不是一线基础模型实验室,正文也没披露具体基准测试结果或开放接入方式,所以分数落在 78–84 区间。但 Project Eden 把世界状态推演和视觉渲染拆成三层,还给了“存档”这个产品钩子,加上近 2 亿美元的融资规模,对关注仿真基础设施的从业者来说信息量够硬。

量子位 · 公众号

招商局狮子山实验室开源 LiOS 架构,把云端大模型延迟压到 30 毫秒,还送了个叠衣服数据集

招商局狮子山人工智能实验室放出了一个叫 LiOS 的边云架构,专门解决机器人怎么用上云端大模型的问题。他们跨机器测下来,从本地摄像头到云端 GPU 显存,单向延迟大约 30 毫秒,这个数字对很多实时控制场景已经够用了。架构里低延迟视频传输模块直接开源,还附带了一个 LeFold 叠衣服数据集。不过正文因为微信环境异常没加载出来,具体用了什么模型、在哪些...

推荐理由:我会先打个折:招商局狮子山实验室不是头部平台,也没看到多源交叉验证,所以影响力止步中等。但这条消息确实给了干货——30ms相机到云端显存的延迟数字,说明端云协同在物理世界干活有戏,不是纯画饼。开源图传模块和叠衣数据集也算实在,同行能直接拿来测。正文没披露具体模型规模、功耗和复杂场景下的抖动,这点先别太激动。

量子位 · 公众号

VAST 拿了近 2 亿美元,首次公开世界模型 Eden 的技术路线

VAST 在 A+ 和 A++ 轮融了近 2 亿美元,同时公布了 Project Eden 世界模型的架构。这套架构把“世界状态怎么变”和“画面怎么渲染”拆开了:先有一个结构化的状态层来推演变化,中间加一层条件接口做翻译,最后再用生成式渲染层出图。正文没披露具体估值、投资方和模型落地时间表,技术细节也只给了三层框架,没有实验数据和验证指标。

推荐理由:VAST拿了近2亿美元A+和A++轮,同时把Project Eden的三层架构亮出来:状态层管世界推演,条件接口层接外部输入,生成式渲染层负责最终画面。这个拆法让世界模型不再是一团黑盒,对做3D和具身智能的人有启发。不过正文没给出任何量化指标、开源时间或实际跑通的场景,所以我会先打个折,不往顶格推。

AI HOT 精选

Runway 与 NVIDIA 联手搞了个 Cosmos Coalition,要一起做开放的世界模型

Runway 宣布以创始成员身份加入 Cosmos Coalition,跟 NVIDIA 和一批头部 AI 实验室搭伙,目标是共建并开源面向物理 AI 的前沿世界模型。第一个项目是 Runway 和 NVIDIA 联合开发的一个基础模型。世界模型说白了就是让 AI 能理解物理规律、预测下一步会发生什么、并据此行动,Runway 说这是他们从第一天就在押...

推荐理由:我会先打个折:正文只给了个标题和一句话摘要,没披露模型规模、训练数据、许可证和任何跑分,所以没法判断实际能力。但 Runway 加 NVIDIA 这个组合,加上“开源物理世界模型”这个定位,确实戳中了机器人、具身智能那帮人现在最头疼的事——没有好用的开源基础模型。这点先别太激动,等他们把模型和协议放出来再看。

AI HOT 精选

英伟达开源 Cosmos 3:一个能看懂物理世界、还能生成动作的 32B 模型

英伟达把 Cosmos 3 称为第一个完全开放的物理 AI 全能模型,意思是它不只能识别图像,还内置了视觉推理、生成 3D 世界状态和直接输出动作的能力。这次放出两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提训练数据规模、具体跑分和推理成本,所以实际能用多好、跑起来贵不贵还得等实测。

推荐理由:我会先打个折:正文是单篇发布稿,没给基准测试、没提许可证细节,也没说训练数据规模和实际部署条件,所以分数卡在 78–84 区间。亮点在于 NVIDIA 第一次把视觉推理、世界生成和动作生成打包成一个开放物理 AI 模型,并给出两个具体尺寸,这对机器人圈子的信号意义不小。但缺少验证信息,这点先别太激动。

AI HOT 精选

MWC26 上海要办人形机器人点球大战,宇树科技等 8 支队伍上场,全程自主、不靠遥控

GSMA 宣布在 2026 年 6 月 24 日至 25 日的 MWC 上海搞一场人形机器人点球比赛,这是全球头一回。8 支国内具身智能团队参加,包括宇树科技、灵心巧手等。规则参照世界杯点球,双方各罚 5 轮,射门和守门的都是机器人,平局后一球定胜负。关键限制是机器人必须自己识别球和守门员位置、决定射门角度并控制发力,不能由人遥控,也不能跑预设脚本。这...

推荐理由:我会先打个折:这是活动预告,不是模型发布或可复现的测试结果,所以分数压在 72–77 之间。但选题本身够抓人,规则里“不许遥控、不许脚本”把门槛拉高了,不再是展台走秀。正文没披露具体评分标准、场地条件和机器人硬件细节,所以别急着当技术里程碑看。如果现场真能稳定自主对抗,那才算数。

AI HOT 精选

OpenAI 成立机器人团队,由 Aditya Ramesh 带队,正在招硬件和系统工程师

OpenAI 发推宣布正式组建机器人团队,由 Aditya Ramesh 负责,目前开放全栈硬件、系统和 ML 工程师岗位。团队方向是软硬件协同设计,短期先帮技术工人干活,远期想给每个人配一台个人机器人。推文没写招聘规模和具体时间表,也没提预算或产品形态,我会先打个折——这更像是一个组队信号,离实际产品还有距离。

推荐理由:OpenAI 把机器人团队和负责人亮出来,是个明确的路线信号,所以 H/K/R 都成立。但产品形态、时间表和招聘规模正文都没提,我会先打个折,不放到 P1。

5月31日星期日

新智元 · 公众号

复旦系团队发布时空一体世界动作模型 STI-WM,称能同时吃进 RGB、点云和本体感知数据做百秒级任务规划

这篇文章来自微信公众号,但页面被环境验证挡住了,正文内容完全看不到。标题和摘要里提到的“复旦铁三角”和“最优物理 AI 路径”都是原文的说法,具体技术细节、实验数据和模型架构都没法核实。已知信息是:一个叫 STI-WM 的模型,主打时空一体的世界动作建模,用在机器人上,支持 RGB 图像、点云和机器人自身状态感知三种输入,能做上百秒的任务规划。另外还提...

推荐理由:这篇东西我会先打个折——全是公司自己说的,没给公开 benchmark 也没说模型能不能复现。但信息量确实不小:STI-WM 把视觉、点云和机器人自身状态揉进一个模型里,号称一次能规划上百秒的动作,这比现在多数 demo 里几秒的规划长得多。半年融了 5 轮、Pre-A 轮 3 个亿,还拉了 NVIDIA 站台,资本侧的信号比技术侧更实。对做机器人落地的人,这条至少能看出一条技术路线和资源密度,所以放在 featured 门槛上。

量子位 · 公众号

复旦系团队发布机器人世界动作模型 STI-WM,把时空信息揉在一起做长任务

沐神智能搞了个叫 STI-WM 的模型,专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态(比如关节角度)同时喂进去,首创了时空一体的架构,不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演,中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数,也没提部署成本,所以实际效果和性价比还得等更多数据。

推荐理由:我会先打个折:正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的,这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构,直接做百秒级推演,这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队,英伟达也出现在标签里,产业和学术两边都有点关联。综合来看,信息够新、够具体,但验证强度不明,所以放在 featured 门槛附近,不往上拔。

AI HOT 精选

特斯拉 FSD V14.3.3 用 4 天 21 小时横穿加拿大,6051 公里全程没让人碰方向盘

一群电动车爱好者开着搭载 FSD V14.3.3 的特斯拉,从温哥华一路跑到哈利法克斯,6051 公里零接管、零退出。变道、过施工路段、甚至每次进超充站自动倒车泊车,全是系统自己干的。这个版本放宽了对驾驶员盯路的判定,长途开下来没那么累。不过得说清楚,这仍是 L2 级辅助驾驶,法规上要求人随时准备接管。正文没提途中遇到的极端天气具体有多糟,也没交代是否...

推荐理由:我会先打个折:这是特斯拉自己放出来的单次行程,没有第三方验证,也没说清路线里高速和城市比例、天气变化、有没有施工路段这些容易翻车的细节。但 6051 公里零干预这个数字本身够硬,版本号也明确,对从业者来说是个可复现可质疑的靶子。分数停在 82 是因为它给了结果却没给边界条件,没法判断这到底是常态水平还是挑了个好天气跑出来的。

5月30日星期六

FT · 科技

英国军方考虑允许 AI 自主发动致命打击,不再需要人类批准

FT 这篇报道的标题很炸,但正文被付费墙挡住了,只看到订阅页面。标题说英国军方正在研究让武器系统在没有人类批准的情况下执行致命打击。具体是哪种武器、在什么条件下可以自主开火、法律框架怎么搭、有没有时间表,这些关键信息正文都没披露。光看标题,这更像是一个政策方向的试探,离真正部署还远,先别太激动。

推荐理由:FT 标题抛出一个很猛的判断,但点进去只有订阅提示,等于只给了一个概念,没给任何能验证的细节。我会先打个折:话题性够强,能让人立刻意识到“人在回路”这条底线正在被试探,所以重要性和传播力都高。但信息缺口太大,没法判断这是政策试探、技术验证还是媒体标题操作,这点先别太激动。

机器之心 · 公众号

英伟达和清华的 γ-World 把世界模型从单机改成了联机,登顶 HuggingFace 日榜

这篇推文本身因为微信环境验证没抓到正文,我只能根据已有的英文摘要和标题来还原。γ-World 是一个多智能体世界模型,核心是把多个 AI 角色放在同一个虚拟环境里互动。它用了一种叫“单纯形位置编码”的方法和 hub token 机制,把多个智能体之间的交互计算成本从平方级降到了线性级。说人话就是:以前每加一个角色,系统要算它和所有其他角色的关系,开销涨...

推荐理由:我会先打个折:这是研究发布,还没看到大规模落地验证,但技术点够具体。Gamma-World 解决的是多个 AI 同时在一个世界里交互时计算量爆炸的问题,用正单纯形位置编码让每个智能体知道彼此位置,再靠 hub token 汇总信息,把原本 O(n²) 的复杂度压到 O(n)。8 个玩家延迟压到 4.5ms 这个数挺实在,说明小规模场景已经能跑顺。不过正文没披露更多玩家数下的表现,这点先别太激动。整体属于有干货、有数字、方向对路的研究,给 featured 合理。

The Verge · AI

想拍你干家务,AI 公司开始用免费保洁换训练数据

一家叫 Shift 的 AI 训练初创公司说,可以免费给纽约人打扫房子,条件是允许他们拍摄保洁员干活的全过程:洗碗、擦台面、掸灰、拖地。这些视频会被用来训练家用机器人。公司还计划扩展到伦敦等城市。但正文没披露用户隐私条款、数据保留期限、后续收费模式,也没说具体什么时候进新城市。我会先打个折:免费保洁听着不错,但等于拿你家当机器人训练场,值不值得自己掂量。

推荐理由:我会先打个折:正文没披露视频拍到什么程度、数据保留多久、会不会扩到别的城市,所以别急着说这是机器人数据的灵丹妙药。但 Shift 这个做法确实戳到了一个真问题——教机器人做家务,缺的就是人在真实厨房里刷碗擦台面的视频。用免费保洁来换,比花钱买数据便宜,也比实验室摆拍更像真活。对从业者来说,看点在于这种采集方式能不能规模化,以及用户到底愿不愿意让陌生人架着相机看自己家。这点先别太激动,等他们公布授权条款和隐私处理再说。

5月29日星期五

The Verge · AI

Shift 用免费上门打扫换机器人训练数据,清洁工会全程被录像

一家叫 Shift 的 AI 训练数据公司说,可以免费帮你打扫家里,条件是让他们录下清洁工擦窗、吸尘、整理的全过程,拿这些视频去训练机器人。他们觉得这些数据的价值足够覆盖服务成本,网站上写的是“你得到干净屋子,我们拿到训练数据,双赢”。宣传片里清洁工戴着一顶有点奇怪的帽子干活。不过正文没提服务覆盖哪些城市、怎么处理隐私和知情同意,也没说已经收集了多少数...

推荐理由:HKR-H 和 HKR-R 都很实在:Shift 把家政服务直接变成机器人数据采集管道,话题性够强。HKR-K 有明确机制,但城市范围、隐私条款、数据集规模正文都没披露,所以先别太激动,暂时放在低曝光位。

AI HOT 精选

特斯拉说 FSD 比人安全十倍,但训练它的员工自己都不敢坐

路透社扒了特斯拉的安全报告,发现“比人类安全 10 倍”这个说法站不住脚。特斯拉拿自己车气囊弹出的数据,去跟全美所有车辆(包括老车)的普通事故率比,11 位交通安全研究员看了直摇头,说这是误导性营销。更扎心的是,9 名前数据标注员和 1 名前工程师爆料,FSD 连避让校车、紧急车辆这种基础操作都还搞不定。为了给投资人看的自动驾驶出租车演示,员工得提前加...

推荐理由:这篇的核心冲突很清楚:特斯拉拿自己的 FSD 事故数据跟全美平均比,得出 10 倍安全的结论,但路透找的 11 位研究员认为这个比法不公平,因为联邦数据里包含大量老旧车型、非自动驾驶场景,统计口径不一样。我会先打个折——文章没给出特斯拉的具体计算方法和原始数据,所以没法验证 10 倍到底水不水,只能确认学界在公开质疑。对从业者来说,这提醒我们看厂商安全报告时要盯紧对比基准,别被单一倍数带着走。

5月28日星期四

NVIDIA 博客

NVIDIA 在 ICRA 发了 8 篇论文,核心是让机器人在仿真里练完直接去现实世界干活

NVIDIA Research 在 ICRA 上展示了 8 篇论文,都围绕一个思路:在仿真里训练机器人,然后直接部署到真实环境。ScheduleStream 让多机械臂并行规划,速度提升 3 倍,代码已开源。COMPASS 导航框架完全不靠真实数据,在仿真里训练后迁移到真机,20 次真实导航测试成功率约 80%,比纯模仿学习基线高了 4.5 倍。Gra...

推荐理由:我会先打个折:这些成功率都是在论文设定的场景里跑出来的,换到更乱的现场不一定能复现。但 8 篇论文同时给出实机数据,而且不是零星的几次测试,ScheduleStream 的 3 倍提速和 COMPASS 的 20 次导航约 80% 成功,至少说明 sim-to-real 的 gap 在可控缩小。对正在纠结仿真训练能不能落地的团队,这组结果比纯讲架构有说服力。

AI HOT 精选

Mistral 推出物理 AI 模型,用一张 GPU 几秒钟预测完整物理场

Mistral 整合了 Emmi AI 团队,发布了一个面向工业工程的物理 AI 基础模型。它能根据几何结构、边界条件或测量数据,在单张 GPU 上用几秒钟预测出完整的物理场(比如温度、应力分布)。正文没披露具体架构、参数量、训练数据规模和实测误差范围,也没给出跟传统数值仿真在精度和速度上的量化对比,所以实际工程可用性还得看后续验证。

推荐理由:Mistral 这次没发新聊天模型,而是直接拿下一个物理 AI 团队,做工业仿真。我会先打个折:正文没披露具体模型名、基准测试、定价和开放方式,所以没法判断它比现有求解器到底准不准、省多少。但方向本身值得关注——如果单 GPU 秒级出完整物理场是真的,对西门子能源这类重工业客户来说,仿真迭代速度会快很多,成本也可能降一截。这点先别太激动,等他们放出可复现的结果再说。

机器之心 · 公众号

ICML 2026:AutoMoT 用大小模型异步分工,在 Bench2Drive 和 nuScenes 上拿了双料第一

这篇文章本身被微信环境验证挡住了,正文内容没抓到,所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型,核心思路是把视觉语言模型和驾驶动作拆成两个专家:一个 4B 的 Qwen3-VL 负责看懂场景,一个 1.6B 的动作专家负责输出驾驶指令,而且两个模型是异步推理的,不用互相等。在...

推荐理由:我会先打个折:双 SOTA 听着唬人,但正文没披露 nuScenes 的具体指标,只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理,大模型负责想、小模型负责开,不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策,1.6B 的 AE 执行,这个组合在算力上挺省。不过论文没提实车验证,纯仿真成绩,这点先别太激动。整体看,对做自动驾驶算法的人有参考价值,但离出圈还差一口气,所以放在 featured 而不是更高一档。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。