跳到正文

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 101–120 条 · 共 167 条

5月17日星期日

机器之心 · 公众号

世界模型的两条路线和一场百亿赌局

这篇文章是机器之心编译自 MoE Capital 的一篇博客,梳理了“世界模型”这个概念的两条发展脉络。一条是 AI 学术圈常说的,让模型在脑子里推演环境变化、做规划;另一条来自游戏和影视工业,追求用模型直接生成逼真的 3D 世界。文章提到,过去一年半里,有超过 100 亿美元的资金涌入了这个方向。里面举了一个具体例子:DreamDojo 这个项目用 ...

推荐理由:这篇是编译的科普+评论,不是一手发布,但把世界模型两条路线讲得清楚,还给了百亿美元和44711小时视频这些具体数字。我会先打个折,因为信息密度集中在解释概念,新事实不多。不过对想快速理解世界模型热度和技术现状的人来说,读这一篇比翻论文省时间。

5月16日星期六

Hacker News 首页

特斯拉披露两起 Robotaxi 事故,远程安全员介入时撞了

特斯拉公开了两起 Robotaxi 碰撞事故,都发生在远程安全员接管车辆的时候。目前 TechCrunch 的报道正文没披露具体地点、时间、伤亡情况和车辆当时的决策状态,也没说清楚远程接管是在什么触发条件下启动的。Hacker News 上只有 27 个点赞和 17 条评论,讨论热度一般。我会先打个折:光凭标题和摘要看不出是系统先出错再交给人,还是人接...

推荐理由:特斯拉主动说了两起 Robotaxi 事故,都跟远程操作员有关,这点本身就挺少见。我会先打个折:原文只有 27 分、17 条评论,信息量很薄,没写事故发生在哪、有没有人受伤、远程接管是人为失误还是系统兜底。所以它更像一个安全信号,还不是能拿来下结论的实锤。对从业者来说,值得看一眼,但别急着激动。

机器之心 · 公众号

机器人为什么需要世界模型?顶尖机构联合发布综述

这篇综述正文被微信的验证页面挡住了,我没法看到具体内容。从标题和已知信息看,NTU MARS Lab 联合几家机构发了一篇 43 页的综述,讲的是机器人世界模型。世界模型可以理解成让机器人脑子里有个对物理世界的模拟器,能预判“我动一下会发生什么”,而不是每次都靠真实试错。文章大概会梳理这类模型怎么定义、用什么架构、在哪些任务上能用,以及当前卡在哪——比...

推荐理由:我会先打个折:标题里的“震撼发布”可以忽略,但内容本身不水。这篇综述把机器人世界模型这件事拆得很细——从“世界模型到底是什么”到怎么搭、怎么测、动作一致性卡在哪,都给了结构化的梳理。对正在琢磨具身智能或仿真训练的人来说,相当于一份现成的地图,省得自己去翻几十篇论文。不过它没给出具体的性能数字或成本对比,所以别指望直接拿来算投入产出。

AI HOT 精选

黄仁勋对 CMU 计算机毕业生说:电工水管工比你们更有前景

黄仁勋在卡内基梅隆大学 2026 届计算机科学毕业典礼上直接说,技工的前景比计算机毕业生好。Randstad 的数据显示技工需求增速是白领的三倍,机器人技术员岗位涨了 107%,而斯坦福研究发现 AI 相关职位的早期就业反而降了 16%。顶级电工年薪能超过 10.6 万美元,还不用背学费贷款。另一边,科技公司今年砸了 7000 亿美元建数据中心,全球到...

推荐理由:黄仁勋在毕业典礼上劝 CS 学生考虑技工,这话本身就够抓眼球。Randstad 给了两个数字:技工需求增速是白领 3 倍,机器人技术员岗位涨 107%,说明动手修机器、调设备的人越来越抢手。对做 AI 的人来说,这等于在问:写代码和管机器人,哪个饭碗更稳。不过这只是 X 上的评论,不是产品发布或政策变动,所以放在低 featured 就够了。

Hacker News 首页

Waymo 召回 3800 辆无人出租车,因为软件 bug 会让车开进积水里

Waymo 主动召回了约 3800 辆自动驾驶出租车。原因是软件里有个漏洞,导致部分车辆在识别路况时,会直接开进路面积水区域。报道里没有说清楚到底发生了多少起涉水事故、具体是哪个软件版本出的问题,也没提修复方案是远程更新还是需要回厂处理。

推荐理由:标题说车开进洪水,正文只给了召回数量和触发条件,事故次数、软件版本、怎么修都没提。我会先打个折,这更像一条有信息增量的安全事件,不是重大技术发布。

AI HOT 精选

杨立昆播客访谈:LLM 走不远,他离开 Meta 去赌世界模型

杨立昆在 Unsupervised Learning 播客里把大语言模型的底牌翻了个遍。他直接说 LLM 这条路有天花板,劝博士生别再往里扎。他预测到 2027 年,纯靠堆语言数据做不出真正的智能。他离开 Meta 后创立的 AMI 公司,核心押注在“世界模型”上——让 AI 像人一样通过观察和互动去理解物理世界,而不是只读文本。访谈里他还跟老搭档 H...

推荐理由:我会先打个折:这是播客访谈,不是论文或产品发布,信息密度高但验证性弱。杨立昆的核心判断是当前大语言模型路线走不到人类级 AI,他把宝押在世界模型和 AMI 上,还给了 2027 这个时间点——这点先别太激动,正文没披露他具体依据什么数据或实验得出这个年份。他离开 Meta 的原因和与 Hinton、Bengio 的分歧是这次的新料,尤其是安全观上的对立,直接关系到行业资源往哪投。整体看,这篇访谈把一位关键人物的技术判断、职业选择和路线分歧打包在一起,对从业者判断风向有帮助,但很多结论还缺公开验证。

5月15日星期五

r/LocalLLaMA

用 Jetson Orin NX SUPER 16GB 做了个完全离线的行李箱机器人,跑 Gemma 4 E4B,没联网也能聊

一个叫 Sparky 的行李箱机器人,核心是一块 Jetson Orin NX SUPER 16GB 的板子,跑的是 Gemma 4 E4B 模型(Q4_K_M 量化版,用 q8_0 做 KV 缓存)。首次响应延迟大概 200 毫秒,生成速度每秒 14 到 15 个 token,上下文窗口 12K。身上挂了 30 多个传感器,但没装 WiFi、蓝牙和蜂...

推荐理由:这是个 Reddit 上的个人项目帖,不是产品发布或论文,所以放在低 featured 档。我会先打个折:200ms 的缓存首 token 延迟和 14-15 tok/s 的生成速度,在 Jetson 上跑 4B 模型算是能用的水平,但别指望它反应飞快。30+ 传感器听起来唬人,正文没细说都是什么传感器、怎么融合的,这点先别太激动。真正有意思的是全离线跑 Gemma 4 E4B 还让机器人带“观点”,把本地推理做成了人格化交互,比单纯报参数好玩。

5月14日星期四

机器之心 · 公众号

灵初智能用10万小时人类操作数据训练机器人,但文章正文被验证页挡住了

这篇微信文章标题说灵初智能(PsiBot)用了10万小时的人类操作数据来训练机器人策略,还提到一个叫W0的世界模型只在训练时做迁移,实际部署只跑R2。但页面被环境异常验证拦住了,正文内容完全看不到,没法确认具体怎么采集数据、在什么任务上验证、效果到底怎么样。

推荐理由:这篇讲的是灵初智能用10万小时人类操作数据训机器人策略,W0世界模型负责训练时的迁移,部署时只跑R2,省算力。我会先打个折:10万小时这个数字挺唬人,但正文没披露数据怎么采集、覆盖哪些任务、成功率多少,也没给论文或开源链接,所以只能当公司说法看。对从业者来说,W0训练期迁移、R2部署这个架构思路有参考价值,但缺验证就不好判断实际效果。整体像产品发布稿,不是可复现的研究,所以放在featured但分数没往上拉。

彭博科技

发那科搭上谷歌,股价直接冲上历史新高

工业机器人巨头发那科宣布跟谷歌合作搞“物理 AI”,消息一出股价飙到历史最高点。正文被 Bloomberg 的付费墙挡了,没披露合作具体做什么、股价涨了多少、什么时候落地。从标题看,市场是把这当成真金白银的利好来炒的——毕竟谷歌在 AI 上的技术积累,配上发那科在工厂里的硬件铺货量,想象空间确实大。但正文没给细节,这点先别太激动,等具体方案出来再看是真...

推荐理由:Bloomberg 的消息源靠谱,Fanuc 股价创纪录这个事实本身就够硬,所以 H 和 R 都给了。但我会先打个折:正文没披露合作机制、股价涨幅、产品细节或时间表,K 完全撑不起来。这点先别太激动,等后续有实质内容再说。

彭博科技

Anduril 估值翻倍至 610 亿美元,刚拿了 50 亿新融资

Anduril 在 Thrive Capital 和 a16z 领投的一轮里融了 50 亿美元,估值直接跳到 610 亿美元,比上一轮翻了一倍。CEO Brian Schimpf 说这笔钱主要砸在三个地方:扩大产线、研发和基础设施。视频里没给具体的收入数字或交付时间表,所以这个估值到底靠多少实际订单撑着,正文没披露。

推荐理由:Anduril 这轮 50 亿直接把估值拉到 610 亿,翻了一倍,说明资本在押注国防 AI 和自主系统的制造规模。钱会砸进工厂、研发和基建,不是纯烧模型,而是铺产能。我会先打个折:正文没披露具体产能目标或交付时间表,所以别急着算回报。对从业者来说,这更像一个信号——国防机器人赛道在加速从原型走向量产,但验证还要看后续订单和交付数据。

5月13日星期三

机器之心 · 公众号

林俊旸被曝离职创业,新 AI 实验室估值冲到 20 亿美元

The Information 爆料,阿里通义千问前技术负责人林俊旸正在为一家新 AI 实验室融资,目标融几亿美元,投后估值可能到 20 亿美元。目前实验室具体研究方向、团队规模和最终估值都还没公开。

推荐理由:这条消息我会先打个折:目前只有 The Information 的融资传闻和估值数字,研究方向、团队构成、产品计划一概没提。亮点是林俊旸本人从阿里出来单干,新 Lab 估值直接喊到 20 亿美元,说明资本还在抢头部 AI 人才。但正文没披露最终估值是否敲定、钱从哪来、做什么方向,这些关键信息都缺着,所以先当一条人才+融资信号看,别太激动。

5月12日星期二

机器之心 · 公众号

宇树出了个能坐人的变形机甲,390 万起卖

宇树科技发了款叫 GD01 的载人机甲,能两条腿或四条腿走路,起步价 390 万人民币。官方说载重差不多 500 公斤,但正文没披露续航、操控方式、量产时间这些关键信息。这个价格放在民用机甲里不算离谱,不过目前只有发布消息,实际交付和性能验证都还没影,先当个概念车看比较合适。

推荐理由:宇树这次发布的 GD01 是个载人变形机甲,能双足走也能四足跑,载重约 500 公斤,起步价 390 万元。我会先打个折:这更像一个炫技的概念产品,离实用还很远,正文也没披露续航、操控方式、安全冗余这些关键信息。但“民用高达”的标签和明确标价本身就自带话题,说明宇树在试探高端消费市场和品牌上限。对从业者来说,看点不是这台机甲能不能打,而是国内机器人公司开始用这种夸张品类抢注意力了。

新智元 · 公众号

智元机器人量产破万,人形机器人已在南昌 3C 产线连续干活 8 小时零失误

智元机器人(AgiBot)公布,到 3 月底已出货超过一万台通用具身机器人。在南昌一条 3C 产线上,他们的人形机器人连续工作了 8 小时,按正式节拍要求完成了 2283 项任务,没有出错。不过,文章正文因为微信环境验证被屏蔽了,具体是哪款机型、任务细节和成本都没法看到。

推荐理由:智元自己报的量产和产线数据,我会先打个折——没有第三方验证,也没披露单台成本和故障率。但 1 万台这个数字在通用机器人圈子里确实少见,南昌那条 3C 线能跑 8 小时零失误,至少说明在特定场景下稳定性过了门槛。正文没提具体客户和付费情况,这点先别太激动。

FT · 科技

中国的人形机器人冠军要上市了,投资人会买单吗?

宇树科技(Unitree)计划今年晚些时候上市。不过这篇 FT 文章正文被付费墙挡住了,只露了个标题和摘要。目前能确认的信息就这么多:有上市计划,时间大概在年内。至于融多少钱、估值多少、在哪上市、具体时间表,正文没披露。我会先打个折——标题里“投资人会不会拥抱”这个问句本身就说明市场对它的商业化能力和估值还有疑虑,这点先别太激动。

推荐理由:FT 的信源和 Unitree 上市计划本身够上 featured,HKR 三项都站得住。但正文没给募资额、估值、交易所和具体时间,我会先打个折,维持 73 分。这点先别太激动,目前只是一篇 Reddit 帖子,没有独立验证,也没看到论文或代码放出来。

5月10日星期日

机器之心 · 公众号

图灵奖得主 Sutton 搬出 1967 年的老公式,想让强化学习在流式训练里不再跑偏

Richard Sutton 团队给流式强化学习(就是来一条数据学一次、不存回放池的那种)开了个新方子,叫“意图更新”。核心思路很直白:先定好这次更新想让模型输出变多少,再反推学习率该设多大,用的还是 1967 年 Kalman 滤波里的一个公式。在 MuJoCo 机器人控制任务上,他们用纯流式、batch size 为 1 的训练方式,让 Inten...

推荐理由:我会先打个折:这篇是研究发布,不是产品级大新闻,所以分数不会冲太高。但 Sutton 的署名加上 Intentional Updates 在极端在线条件下的实验结果,确实给流式 RL 提供了一个很省算力的新思路。1/140 的 FLOPs 对比很直观,batch=1、无回放这些条件也贴近真实部署,对 RL 圈子来说信息量够硬。整体判断是强研究信号,但市场影响力有限,放在 78–84 这个区间合理。

机器之心 · 公众号

谷歌 Ted Xiao 把近十年机器人学习分成三个时代,从 RT-1 到 RT-2 再到规模化

这篇文章的正文被微信环境异常拦截了,实际内容无法读取。从标题和已有英文摘要看,Ted Xiao 的复盘主要讲谷歌机器人团队怎么从 RT-1 用 8.7 万条遥操作轨迹训练,走到 RT-2 把 50 亿到 550 亿参数的视觉语言模型改造成视觉-语言-动作策略。具体三个时代怎么划分、每个阶段踩了什么坑、规模化后效果到底提升多少,正文没披露,没法展开。

推荐理由:我会先打个折:这不是新发布,是一篇回顾性梳理,所以分数没往 80 以上走。但作者身份和内部数字让它值得上推荐位。Ted Xiao 把谷歌机器人学习拆成三个阶段,从遥操作采数据到把大模型当机器人脑子用,脉络清楚。RT-1 的 8.7 万条轨迹说明早期靠人工遥控攒数据的笨功夫,RT-2 用 5B 到 55B 的 VLM 改策略,点出了现在大家纠结的核心——模型大了能不能直接控硬件。正文没披露 RT-2 在真实场景的失败率或延迟数据,这点先别太激动。整体适合给做具身智能的人当路线图看。

5月9日星期六

AI HOT 精选

特斯拉用视觉AI提前“看”到碰撞,让气囊和安全带更早启动

特斯拉把车上摄像头看到的画面和碰撞传感器结合起来,让安全系统能提前判断要撞车了,不等传感器确认就先把安全带收紧、气囊准备好。团队用真实事故数据和仿真回放,拿人体模型测受力,发现早一点启动保护能明显降低预估伤害。这次改进通过OTA推给车主,但正文没披露具体支持哪些车型,也没给出伤害风险降低了多少的量化数字。

推荐理由:我会先打个折:信息来自马斯克的一条帖子,正文没披露 OTA 覆盖了哪些车型、伤亡率具体降了多少、验证方法是什么。所以它更像一个值得关注的产品更新,而不是一篇必须写的硬核发布。亮点在于把视觉预判和被动安全联动,思路清晰,但缺的数据让说服力打了折扣。

FT · 科技

德国无人机初创公司 Helsing 估值冲到 180 亿美元,投资人正往军工赛道砸钱

Helsing 计划在新一轮融资里融 12 亿美元,估值达到 180 亿美元。这家德国公司背后有 Spotify 创始人 Daniel Ek 站台。正文被付费墙挡住了,没披露更多技术细节或财务数据,所以这个估值到底靠什么撑起来,目前还看不清。

推荐理由:HKR 三项都站得住:FT 报道 Helsing 要拿 12 亿、估值 180 亿,是军工 AI 领域一个实打实的融资信号。没给更高分是因为正文只讲了钱的事,没披露具体产品能力或技术突破,信息量就停在资本层面。

机器之心 · 公众号

港科大和社区开源了 StarVLA,一个框架把主流视觉-语言-动作模型串了起来

StarVLA 把 VLA(视觉-语言-动作模型)里常用的主干网络、动作输出头、训练策略和评测接口都做成了可插拔的模块,不用再为不同论文各搭一套代码。仓库在 GitHub 上已经拿到 2.2k 星,支持的基准包括 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。正文没披露具体训练成本和...

推荐理由:我会先打个折:StarVLA 目前是框架级发布,不是新模型,所以权重不会给到模型首发那么高。但它的价值很实在——把多种 VLA 架构塞进同一套接口,训练和评估不用再东拼西凑,2.2k star 说明社区已经用脚投票了。正文没披露框架内各方法的横向对比数据,这点先别太激动,但统一工具这件事本身对机器人方向的工程效率提升是实打实的。

5月8日星期五

AI HOT 精选

机器人终局:一份物理 AGI 路线图,用大语言模型的成功逻辑来推演

演讲者把机器人做成人形通用智能拆成六块:视频世界模型当第二预训练范式,世界行动模型(WAM)负责把感知转成动作,数据收集策略对标特斯拉 FSD 的物理数据飞轮,EgoScale 和灵巧性缩放定律试图量化训练规模与手部操作能力的关系,物理强化学习用来跑通最后一公里,DreamDojo 则是一个端到端的神经物理引擎。整体思路是照搬大语言模型的成功路径,但正...

推荐理由:我会先打个折:这是演讲者个人的路线图,不是论文或产品发布,所以别当官方公告看。但它的好处是把物理 AGI 拆成了 6 个能聊的模块,并且用 LLM 的发展阶段来类比,让做机器人的人能快速对齐讨论框架。正文没给出每个模块的具体验证结果或数据,所以这条路线图更多是观点而非实证。对从业者来说,值得扫一眼,但暂时不用太激动。