跳到正文

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 21–40 条 · 共 167 条

7月31日星期五

纽约时报中文网

美国 FCC 提议禁止进口中国人形机器人,中国商务部放话要反制

美国联邦通信委员会(FCC)周二以国家安全为由,提议限制人形和动物形态机器人的进口。虽然没点名,但中国厂商在全球人形机器人市场占主导,所以中国商务部周四直接回怼,说这就是歧视,并威胁要报复。美方的担心有两点:一是这些机器人进家、进公司后可能变成数据收集器,二是把先进机器人当成战略技术。但文章没提 FCC 这个提案的具体时间表和投票安排。中国这边确实有底...

推荐理由:这条新闻把中美 AI 硬件摩擦从芯片拉到了人形机器人,FCC 首次以国家安全为由提议限制进口,北京当天回怼并威胁报复,政策信号够强。我会先打个折,因为正文没披露提案的具体时间表和投票安排,落地节奏还不清楚,所以分数没给更高。

The Verge · AI

Google DeepMind 的新模型能一次性指挥机器人的全身关节

Gemini Robotics 2 是个能看图直接输出全身动作指令的模型,不再只控制一条胳膊。在演示里,Apptronik 的 Apollo 2 机器人从架子上取棒球手套,从手指到脚底的动作是协同完成的。为了让动作看起来更自然,Google 说他们用了 1,040 组偏好样本做对齐——这个量不算大,我会先打个折,别指望它马上就能像人一样丝滑。目前还关在...

推荐理由:Google DeepMind 把机器人控制从单臂扩展到了全身协调,Apptronik Apollo 2 的演示里从手指到脚底的动作是连贯的,还给出了 1,040 组偏好样本做对齐这个具体数字。没给 p1 是因为现在还关在实验室里,没有公开测试或部署时间表,真实世界的泛化能力没法验证。

7月29日星期三

Hacker News 首页

白宫认定外国产先进机器人威胁国家安全,将限制 FCC 设备授权

白宫跨部门小组在 7 月 27 日做出判定:所有外国生产的先进机器人对美国国家安全构成不可接受的风险,应被列入 FCC 的“覆盖清单”。这份 5 页的 PDF 文件没有给出生效日期,也没点名具体厂商。文件里说的“先进机器人”包括四足、双足、轮式和履带式设备,理由是它们全身装满高精度传感器(激光雷达、热成像、触觉等)且常年联网,容易被远程劫持或偷走敏感数...

推荐理由:白宫跨部门小组在 7 月 27 日判定外国产的先进机器人对美国国家安全构成不可接受的风险,要列入 FCC 的“覆盖清单”。文件没点名具体厂商,也没给生效日期,所以实际执行力度还得观望。但技术理由写得明白:四足、双足、轮式、履带式设备全身装满高精度传感器,又常年联网,攻击面太大。我会先打个折——没厂商名单、没时间表,政策落地前变数不少,但信号本身已经够硬,做硬件出口的团队最好现在就翻翻合规手册。

7月27日星期一

Import AI

AI 用 14 小时复现人类数周编程任务,机器人叠衣服成功率 99.1%

Epoch 和 METR 的 MirrorCode 基准测试显示,Claude Opus 4.7 在 14 小时内、花 251 美元推理成本,重新实现了一个人类需要 2 到 17 周才能完成的软件项目。测试方式是只给模型命令行交互权限,不让看源码也不让上网,让它从零写出功能一样的程序。25 个目标程序里有 17 个至少有一次满分复现,但 ruff 这类...

推荐理由:MirrorCode 是 Epoch 和 METR 搞的一个长周期编程基准,Claude Opus 4.7 用 14 小时复现人类数周的工作,数字和失败案例都摆出来了。HKR 三条全中,但这是 newsletter 摘要不是原论文,而且任务复杂度高,我会先打个折——信息密度够,但别当完整评测报告看。

7月22日星期三

TechCrunch · AI

Anthropic 被传要收购机器人公司 Physical Intelligence,CEO 火速否认

上周末 AI 圈传 Anthropic 要收购机器人公司 Physical Intelligence,消息传得很快,但 Physical Intelligence 的 CEO 马上否认了。TechCrunch 核实后发现,两家确实谈过收购,只是没谈成,具体条款和破裂原因都没披露。Physical Intelligence 来头不小,由硅谷新贵 Lach...

推荐理由:这条消息的传播路径本身就很有意思:先有传闻,然后 CEO 否认,接着媒体挖出确实谈过但没成。信息增量在于把“谣言”变成了“谈崩了的真事”,但崩在哪、谁先撤的、条款长什么样,正文全都没说。我会先打个折,因为信息密度其实不高,核心事实就一句“谈过,没成”。不过对圈内人来说,Anthropic 碰机器人这个动作本身就值得标记,哪怕只是试探。

7月20日星期一

Hacker News 首页

小米开源机器人基础模型 XR-1:用 10 万小时无实机视频预训练,新任务学不到 10 小时成功率 75%

小米机器人团队放出了一个开箱即用的机器人基础模型 XR-1,代码、权重和论文都公开了。它的思路分两步:先用 10 万小时不带真实机器人的操作视频做预训练,覆盖 1700 多个场景,让模型学会“看到画面变化该输出什么动作”;再用 7200 小时真机数据做后训练,把动作能力对齐到具体机器人上,并让模型能听懂自然语言指令。预训练阶段出现了干净的缩放规律——数...

推荐理由:小米机器人开源了 XR-1,一个带代码和权重的机器人基础模型。两阶段训练路线(10 万小时无真机预训练 + 7200 小时真机后训练)和预训练缩放规律是硬信号,直接对标 π 0.5。我会先打个折:正文没披露真机后训练的具体任务成功率和泛化测试细节,这点先别太激动。但开源全套这个动作本身,对行业来说比发一篇论文管用。

AI HOT 精选

黄仁勋东京之行敲定三件事:日本主权 AI 工厂、机器人联盟和芯片材料供应

黄仁勋 7 月 15 到 16 号在东京见了一圈日本产业界的人,带走了三份框架协议。最核心的是 Noetra 项目:政府拉上软银、索尼、NEC、本田等 44 家本土公司,五年内砸 1 万亿日元(约 62 亿美元),要自己搞一套给机器人、汽车和工厂产线用的 AI,不想把命脉交给美国或中国的模型。同时,Nvidia 跟发那科、安川电机等机器人厂商组了个 C...

推荐理由:黄仁勋这趟东京行带回了三份实打实的框架协议,Noetra 项目 62 亿美元、44 家本土公司入局,主权物理 AI 的架势拉得很足。H、K、R 三个维度都踩中了:新闻性够强,知识增量明显,对从业者的实际影响也直接。没给更高分是因为现在还停留在框架协议阶段,钱和公司名单有了,但具体执行时间表和模型能力都没披露,先打个折观望一下。

7月18日星期六

TechCrunch · AI

Agility Robotics 在特斯拉后院开了个人形机器人训练中心

Agility Robotics 在加州 Fremont 租下一个 6 万平方英尺的场地,专门用来训练他们的双足机器人 Digit,离特斯拉计划今年投产 Optimus 的工厂就隔一条高速。CEO Peggy Johnson 说 Digit 已经在赚钱了,客户包括亚马逊、GXO、舍弗勒和丰田加拿大工厂,公司声称手里有 3 亿美元的合同订单。不过正文没披...

推荐理由:Agility 把训练场开到特斯拉 Optimus 工厂对面,这个选址本身就是个信号。3 亿美元订单和亚马逊等客户名字让故事有实感,说明双足机器人确实在进仓库干活了。但正文没披露实际营收规模、利润率或部署台数,所以没法判断商业健康度,我会先打个折,别把订单额直接当收入看。

7月16日星期四

NVIDIA 博客

英伟达发布两款新的 Jetson Thor 边缘计算模块 T3000 和 T2000,把 Blackwell 架构塞进了更小、更省电的机器人电脑里

英伟达推出了 T3000 和 T2000 两款基于 Thor 架构的新模块。T3000 算力 865 FP4 teraflops,配 32GB 内存和 273GB/s 带宽,体积和功耗大约是之前 T5000 的一半,但跑多模态模型的推理速度差不多,能帮客户在高内存价格下省一笔硬件钱。T2000 算力 400 FP4 teraflops,16GB 内存,...

推荐理由:英伟达发了 Jetson Thor 系列的新模块 T3000 和 T2000,主打边缘机器人。T3000 的卖点很直接:算力 865 FP4 teraflops,配 32GB 内存和 273GB/s 带宽,体积和功耗砍到 T5000 的一半左右,但跑多模态模型推理速度没怎么掉。我会先打个折——这是官方博客,没给第三方跑分,也没说什么时候能大规模买到。不过内存优化这块确实戳中痛点,现在内存贵,能省就是赚。T2000 给到 400 FP4 teraflops 和 16GB 内存,定位更低一些。整体看,对做机器人或边缘 AI 的团队是个值得跟进的信号,但...

7月9日星期四

AI HOT 精选

特斯拉 Optimus 三代人形机器人设计定型,马斯克要求年底周产 2000 台,否则换掉整个采购团队

特斯拉给供应商下了死命令:9 月要把零件产能拉到每周 1000 台,年底冲到 2000 到 2500 台,折算下来一年能供 10 万台机器人的料。8 月的几百台订单已经下了。六月底高管会上,马斯克拍板通过了 Optimus 第三代最终设计,还放话年底达不到产能目标就开掉整个采购团队。弗里蒙特工厂原来造 Model S/X 的生产线现在改成了机器人产线。...

推荐理由:三代 Optimus 设计冻结加上第一批具体产能目标,信号够硬。马斯克的裁员狠话有话题性,但消息目前只来自单一供应商渠道,所以分数压在 featured 档的 78,没再往上拉。

7月8日星期三

Hacker News 首页

Mistral 发布 Robostral Navigate:一个只用单摄像头的机器人导航模型

Mistral 推出了一个 80 亿参数的模型,让机器人只靠一个普通 RGB 摄像头就能在室内外认路,直接输出速度和转向角。它跳过了激光雷达和高精地图,思路是降低硬件门槛。不过公告里没提延迟、帧率、跑在什么硬件上、用了多少训练数据,也没给具体的测试基准分数。这点先别太激动,等第三方实测再说。

推荐理由:Mistral第一个机器人模型,纯视觉导航,80亿参数,有明确输入输出,是个实在的发布。但公告没提延迟、帧率、硬件需求、训练数据和基准分数,没法判断真实可用性,所以先放在featured档,等第三方实测再说。

TechCrunch · AI

贝索斯押注的这家公司认为,游戏数据可能是通往通用人工智能的钥匙

General Intuition 刚拿了 3.2 亿美元融资,估值 23 亿。CEO Pim de Witte 在播客里说,ChatGPT 这类大语言模型对空间和时间的理解很差,而游戏数据正好能补上这个缺口。他们用 8 分钟的真实世界数据就让一个机器人能在办公室里自己认路,这点挺有意思。公司还拒绝了 OpenAI 的收购,自己做了个叫 Nerve 的...

推荐理由:3.2 亿美元融资、23 亿估值、贝索斯撑腰还拒了 OpenAI 的收购,这些要素堆在一起本身就有故事性。但真正让它不只是融资新闻的,是那个 8 分钟数据让机器人自主导航的例子——它把一个听起来很虚的'游戏数据通向 AGI'的说法,落到了一个可感知的效率数字上。我会先打个折:信息来自播客访谈,不是产品发布或论文,所以实际效果和泛化能力还没法验证。不过对从业者来说,这个思路本身就有参考价值,尤其是当他们正在头疼怎么用有限数据教机器人理解空间的时候。

7月7日星期二

AI HOT 精选

美国无人战车首次在乌克兰投入实战,Forterra 已部署超 100 辆

美国国防科技公司 Forterra 公开说,过去九个月他们往乌克兰战区送了超过 100 辆自动驾驶全地形车,主要干后勤和侦察的活。这是目前已知美国公司最大规模的一次地面无人车实战部署。公司高管讲得很直白:没上过战场,什么国防科技都不算数。乌克兰转向地面无人装备,是因为天上无人机太多,士兵在地面几乎无处可躲,太容易挨炸。不过文章没提这些车有没有装武器,也...

推荐理由:这是目前已知美国公司最大规模的地面无人车实战部署,有具体数量和时长,不是公关吹风。文章没提武器化和自主等级,所以先别太激动,但光是“上战场”这个事实就够硬了。

7月3日星期五

Hacker News 首页

Yann LeCun 说大语言模型“不聪明”,他的新公司 AMI Labs 在造一种更灵活的 AI

Yann LeCun 在 VivaTech 大会上直接说,ChatGPT 这类大语言模型处理不了真实世界的复杂情况,靠它们实现人类水平的智能走不通。他 2025 年离开 Meta 后创办了 AMI Labs,正在开发一种叫 JEPA 的新架构。JEPA 不靠死记硬背统计规律,而是学习抽象表征,能判断出哪些信息没用、不用瞎猜——比如一根竖着的笔松手后会倒...

推荐理由:LeCun 离开 Meta 后第一次以 AMI Labs 身份在 BBC 上完整讲 JEPA 路线,时机和平台都够分量。没给更高分是因为目前只有方向性描述,没有可跑的模型或基准测试数据,离落地还远,这点先别太激动。

6月29日星期一

Import AI

NVIDIA 给机器人搭了个自我进化循环;腾讯公开万卡集群调试工具;一篇论文提醒我们:人类预测技术走向的能力烂透了

NVIDIA 的 ENPIRE 系统让实体机器人像编程智能体一样,通过试错来自我改进。在插 GPU、剪扎带这类任务上成功率能干到 99%,但自动评估和自动复位在更复杂的活上还是会掉链子。硬件用的是双臂协作平台,每台配一张 RTX 5090。测试里 GPT-5.5 和 Claude Opus 4.7 表现互有胜负,而且多智能体一起干通常比单打独斗分高。不...

推荐理由:NVIDIA的ENPIRE系统把智能体那套试错循环搬到了实体机器人上,插GPU、剪扎带这类活能干到99%成功率,但自动评估和自动复位在更复杂的任务上还是会掉链子。硬件是双臂平台,每台一张RTX 5090。测试里GPT-5.5和Claude Opus 4.7表现互有胜负,多智能体一起干通常比单打独斗分高。不过这是简报摘要,不是原始论文,信息密度被稀释了,上限就打到78分。

6月26日星期五

AI HOT 精选

General Intuition 融了 3.2 亿美元,赌游戏操作数据能训练出通用的 AI 智能体

这家公司拿了 3.2 亿美元,想用几百万小时的游戏录像来训练 AI。创始人 Pim de Witte 的逻辑是,玩家在游戏里的按键、鼠标移动和一连串决策,比纯文本更能教会模型什么是“物理直觉”。他们打算把训出来的模型卖给机器人公司和游戏开发商。不过,正文没披露这轮融资的估值和具体投资人是谁。

推荐理由:3.2 亿美元不是小数目,用游戏操作数据教模型理解物理世界,这个切入点有想象力。我会先打个折:正文没写估值和具体投资人,这两块信息缺口让重要性停在 78 而不是更高。但思路本身够硬,对从业者有参考价值,所以还是放进 featured。

6月17日星期三

AI HOT 精选

AWS 开源 Strands Robots SDK:一套代码同时跑仿真和真机,数据直接存到 Hugging Face Hub

AWS 把 LeRobot 这套机器人训练工具包封装成了一个统一的智能体,叫 Strands Robots SDK,用 Apache 2.0 协议开源。默认跑 MuJoCo 物理仿真,不用买硬件就能先试;想上真机时把参数改成 mode="real" 就行,仿真和真机代码完全一样,只差这一个关键字。你操作机器人的演示数据会被录成 LeRobotDatas...

推荐理由:AWS 把 LeRobot 封装成一个统一智能体 SDK,一键切换仿真和真机,对机器人开发者是个趁手工具。但纯物理机器人的话题在 AI 应用层读者里热度有限,R 轴没完全打满,刚好卡在 featured 门槛上。

6月16日星期二

AI HOT 精选

Qwen 发布机器人操作模型 RobotManip,靠对齐而非堆预训练数据让机械臂听懂人话干活

Qwen 团队放出了 Qwen-RobotManip,一个给机械臂用的基础模型。核心思路不是继续堆预训练数据,而是做对齐——用偏好样本教模型学会正确的操作风格,让规模真正发挥作用。演示里,Qwen-Omni 会实时观察桌面,随口发指令,RobotManip 现场执行,没有预设任务清单,能叠碗、叠衣服、做汉堡、插花。模型在多种真实机械臂平台上跑过,对没见...

推荐理由:Qwen-RobotManip 不是又一个更大的机器人模型,它用对齐替代更多预训练数据来释放规模潜力,演示里 Qwen-Omni 随口发指令、机械臂现场执行,效果挺直观。我会先打个折,因为正文没披露偏好数据的规模、采集成本和对齐方法的具体细节,验证强度还不好判断。分数定在 82,低于 85 就是因为这些信息缺口,但方向本身对行业有参考价值。

6月12日星期五

TechCrunch · AI

贝索斯的 Prometheus 拿了 120 亿美元,估值 410 亿,要做实体世界的“通用工程师”

Prometheus 刚融了 120 亿美元,投后估值 410 亿。这家公司想做一个能自动干重型工程和药物设计的实体 AI,相当于给物理世界配个通用工程师。不过正文只说了融资金额和估值,没提技术路线、团队背景,也没说钱具体怎么花。估值很高,但信息太少,先别急着下判断。

推荐理由:120 亿融资、410 亿估值,贝佐斯站台,这种体量的实体 AI 融资很少见,值得放出来。但文章太薄,技术方案、团队、资金用途一概没写,K 拿不到,分数就停在 78。

6月10日星期三

AI HOT 精选

华为云发布具身AI平台CloudRobo,打通从数据到部署的全流程

华为云在INSPIRE2026上推出了CloudRobo,一个覆盖数据、模型训练、部署和集成的具身AI平台。它基于PB级数据底座,意思是能处理海量可信数据。现场演示了几个关键能力:数据和模型可以双向评估,主动力控模型能快速组装,机器人上云只要几小时,模型部署压缩到分钟级。合作方包括国家地方共建人形机器人创新中心、Yijiahe Technology和上...

推荐理由:华为云在INSPIRE2026上发了CloudRobo,一个覆盖数据、训练、部署到集成的具身AI平台。现场演示了数据和模型双向评估、主动力控快速组装这些能力,还给了分钟级部署、小时级上云的具体数字,比纯口号强。但这是厂商自己发布的消息,没有第三方验证,也没展开讲实际案例里的成功率或成本,所以我会先打个折,分数停在78。