跳到正文

#具身智能

今日 2 条

7月7日星期二

AI HOT 精选

美国无人战车首次在乌克兰投入实战,Forterra 已部署超 100 辆

美国国防科技公司 Forterra 公开说,过去九个月他们往乌克兰战区送了超过 100 辆自动驾驶全地形车,主要干后勤和侦察的活。这是目前已知美国公司最大规模的一次地面无人车实战部署。公司高管讲得很直白:没上过战场,什么国防科技都不算数。乌克兰转向地面无人装备,是因为天上无人机太多,士兵在地面几乎无处可躲,太容易挨炸。不过文章没提这些车有没有装武器,也...

推荐理由:这是目前已知美国公司最大规模的地面无人车实战部署,有具体数量和时长,不是公关吹风。文章没提武器化和自主等级,所以先别太激动,但光是“上战场”这个事实就够硬了。

7月3日星期五

Hacker News 首页

Yann LeCun 说大语言模型“不聪明”,他的新公司 AMI Labs 在造一种更灵活的 AI

Yann LeCun 在 VivaTech 大会上直接说,ChatGPT 这类大语言模型处理不了真实世界的复杂情况,靠它们实现人类水平的智能走不通。他 2025 年离开 Meta 后创办了 AMI Labs,正在开发一种叫 JEPA 的新架构。JEPA 不靠死记硬背统计规律,而是学习抽象表征,能判断出哪些信息没用、不用瞎猜——比如一根竖着的笔松手后会倒...

推荐理由:LeCun 离开 Meta 后第一次以 AMI Labs 身份在 BBC 上完整讲 JEPA 路线,时机和平台都够分量。没给更高分是因为目前只有方向性描述,没有可跑的模型或基准测试数据,离落地还远,这点先别太激动。

6月29日星期一

Import AI

NVIDIA 给机器人搭了个自我进化循环;腾讯公开万卡集群调试工具;一篇论文提醒我们:人类预测技术走向的能力烂透了

NVIDIA 的 ENPIRE 系统让实体机器人像编程智能体一样,通过试错来自我改进。在插 GPU、剪扎带这类任务上成功率能干到 99%,但自动评估和自动复位在更复杂的活上还是会掉链子。硬件用的是双臂协作平台,每台配一张 RTX 5090。测试里 GPT-5.5 和 Claude Opus 4.7 表现互有胜负,而且多智能体一起干通常比单打独斗分高。不...

推荐理由:NVIDIA的ENPIRE系统把智能体那套试错循环搬到了实体机器人上,插GPU、剪扎带这类活能干到99%成功率,但自动评估和自动复位在更复杂的任务上还是会掉链子。硬件是双臂平台,每台一张RTX 5090。测试里GPT-5.5和Claude Opus 4.7表现互有胜负,多智能体一起干通常比单打独斗分高。不过这是简报摘要,不是原始论文,信息密度被稀释了,上限就打到78分。

6月26日星期五

AI HOT 精选

General Intuition 融了 3.2 亿美元,赌游戏操作数据能训练出通用的 AI 智能体

这家公司拿了 3.2 亿美元,想用几百万小时的游戏录像来训练 AI。创始人 Pim de Witte 的逻辑是,玩家在游戏里的按键、鼠标移动和一连串决策,比纯文本更能教会模型什么是“物理直觉”。他们打算把训出来的模型卖给机器人公司和游戏开发商。不过,正文没披露这轮融资的估值和具体投资人是谁。

推荐理由:3.2 亿美元不是小数目,用游戏操作数据教模型理解物理世界,这个切入点有想象力。我会先打个折:正文没写估值和具体投资人,这两块信息缺口让重要性停在 78 而不是更高。但思路本身够硬,对从业者有参考价值,所以还是放进 featured。

6月17日星期三

AI HOT 精选

AWS 开源 Strands Robots SDK:一套代码同时跑仿真和真机,数据直接存到 Hugging Face Hub

AWS 把 LeRobot 这套机器人训练工具包封装成了一个统一的智能体,叫 Strands Robots SDK,用 Apache 2.0 协议开源。默认跑 MuJoCo 物理仿真,不用买硬件就能先试;想上真机时把参数改成 mode="real" 就行,仿真和真机代码完全一样,只差这一个关键字。你操作机器人的演示数据会被录成 LeRobotDatas...

推荐理由:AWS 把 LeRobot 封装成一个统一智能体 SDK,一键切换仿真和真机,对机器人开发者是个趁手工具。但纯物理机器人的话题在 AI 应用层读者里热度有限,R 轴没完全打满,刚好卡在 featured 门槛上。

6月16日星期二

AI HOT 精选

Qwen 发布机器人操作模型 RobotManip,靠对齐而非堆预训练数据让机械臂听懂人话干活

Qwen 团队放出了 Qwen-RobotManip,一个给机械臂用的基础模型。核心思路不是继续堆预训练数据,而是做对齐——用偏好样本教模型学会正确的操作风格,让规模真正发挥作用。演示里,Qwen-Omni 会实时观察桌面,随口发指令,RobotManip 现场执行,没有预设任务清单,能叠碗、叠衣服、做汉堡、插花。模型在多种真实机械臂平台上跑过,对没见...

推荐理由:Qwen-RobotManip 不是又一个更大的机器人模型,它用对齐替代更多预训练数据来释放规模潜力,演示里 Qwen-Omni 随口发指令、机械臂现场执行,效果挺直观。我会先打个折,因为正文没披露偏好数据的规模、采集成本和对齐方法的具体细节,验证强度还不好判断。分数定在 82,低于 85 就是因为这些信息缺口,但方向本身对行业有参考价值。

6月12日星期五

TechCrunch · AI

贝索斯的 Prometheus 拿了 120 亿美元,估值 410 亿,要做实体世界的“通用工程师”

Prometheus 刚融了 120 亿美元,投后估值 410 亿。这家公司想做一个能自动干重型工程和药物设计的实体 AI,相当于给物理世界配个通用工程师。不过正文只说了融资金额和估值,没提技术路线、团队背景,也没说钱具体怎么花。估值很高,但信息太少,先别急着下判断。

推荐理由:120 亿融资、410 亿估值,贝佐斯站台,这种体量的实体 AI 融资很少见,值得放出来。但文章太薄,技术方案、团队、资金用途一概没写,K 拿不到,分数就停在 78。

6月10日星期三

AI HOT 精选

华为云发布具身AI平台CloudRobo,打通从数据到部署的全流程

华为云在INSPIRE2026上推出了CloudRobo,一个覆盖数据、模型训练、部署和集成的具身AI平台。它基于PB级数据底座,意思是能处理海量可信数据。现场演示了几个关键能力:数据和模型可以双向评估,主动力控模型能快速组装,机器人上云只要几小时,模型部署压缩到分钟级。合作方包括国家地方共建人形机器人创新中心、Yijiahe Technology和上...

推荐理由:华为云在INSPIRE2026上发了CloudRobo,一个覆盖数据、训练、部署到集成的具身AI平台。现场演示了数据和模型双向评估、主动力控快速组装这些能力,还给了分钟级部署、小时级上云的具体数字,比纯口号强。但这是厂商自己发布的消息,没有第三方验证,也没展开讲实际案例里的成功率或成本,所以我会先打个折,分数停在78。

6月9日星期二

AI HOT 精选

工信部和国资委发通知,要求人形机器人等产品在 2026 年底前完成场景验证并常态化部署

两部门联合启动 2026 年度人形机器人与具身智能实景实训专项行动,目标是到 2026 年底,人形机器人等重点产品要在工业、服务、特种等代表性场景里完成应用验证,并进入常态部署的“作业模式”。通知要求凝练出 100 个以上高价值应用场景,带动万台级的落地能力。具体任务包括:各省份至少选 20 个、央企至少选 10 个真实场景单元做实训空间;由用户单位和...

推荐理由:这条政策给了人形机器人一个很具体的交卷时间——2026年底要常态部署,不是再搞几台演示。我会先打个折:正文没披露预算怎么出、试点单位是谁、万台落地靠采购还是租赁,这些缺口让“万台”听起来更像目标而非订单。但亮点在于场景数量(100+)和实训空间要求(每省至少20个),说明这次是想把机器人塞进真实产线和服务现场去磨,不是实验室里跑分。对从业者来说,时间表和规模数字比“支持”“鼓励”实在,所以放在 featured 低位。

6月8日星期一

Import AI

AI 学会钻社会规则的空子,Anthropic 内部代码量一年涨了 8 倍

这期有三件事值得看。第一,一个新基准 SocioHack 测试了 AI 在现实规则里找漏洞的能力,比如刷信用卡积分、在学校刷分,用强化学习训出来的模型在历史漏洞上复现精度超过 90%。第二,Anthropic 自己发了一篇报告,说 2026 年合并进代码库的代码量是 2021 到 2024 年的 8 倍,他们认为一种比较朴素的“递归自我改进”可能已经开...

推荐理由:这期三个条目都有实打实的数字撑腰。SocioHack 那个基准测的是模型在现实规则里钻空子的能力,90% 以上的复现精度说明强化学习训出来的模型确实会系统性找漏洞,不是偶然行为。Anthropic 自己报的代码合并量 8 倍增长,等于用内部数据承认了一种朴素的递归自我改进已经在发生,这个披露本身比数字还重要。无人机 RL 把延迟压到 11 毫秒,意味着端侧强化学习在物理系统上能跑实时了。唯一的小折扣:这是 newsletter 汇总,不是一手发布,每条单独拎出来都能过线,合在一起信息密度很高。

AI HOT 精选

高德发布 ABot-Earth0.5,用一张卫星图 10 分钟就能生成 3D 城市

高德搞了个叫 ABot-Earth0.5 的模型,号称是全球第一个原生 3D 的城市世界模型。它已经覆盖了 190 多个国家和地区。用起来很简单,你扔给它一张卫星图或者一段文字描述,它就能在普通消费级显卡上,大概 10 分钟给你生成一大片公里级的 3D 城市场景。出来的素材是 3DGS 格式,能直接拖进 Unity、虚幻引擎这些软件里接着用。按他们算的...

推荐理由:高德这个ABot-Earth0.5把3D城市生成的门槛压得很低:消费级显卡、10分钟、公里级、直接出可编辑资产。我会先打个折,正文没披露生成精度和几何一致性有多高,也没给实际案例对比,所以“全球首个原生3D城市世界模型”这个说法先别太激动。但即便只做到七八成,对需要大量3D场景的团队来说也挺省钱。H/K/R三条都踩实了,重要性给80合理。

6月6日星期六

新智元 · 公众号

ICRA 2026 叠衣服比赛,狮子山 AI 实验室拿了真机决赛第一

狮子山 AI 实验室在 ICRA 2026 LeHome 挑战赛的真机决赛里拿了第一。他们用一套叫 LiOS 的系统,把训练、部署、轨迹采样和 Real2Sim 遥操作串成一个数据循环,让机器人学会叠衣服这类软物操作。不过文章正文被微信环境验证挡住了,具体技术细节、比赛数据和对比成绩都没看到,只能从标题和现有摘要知道结果。

推荐理由:我会先打个折:正文被微信环境验证挡住了,技术细节、比赛数据和对比成绩都没看到,只能从标题和摘要知道结果。叠衣服拿第一确实抓眼球,LiOS 的 Real2Sim 遥操作循环听起来也靠谱,但信息缺口太大,没法判断这套方案的泛化能力和真实成本。这点先别太激动,等看到完整论文再下结论。

机器之心 · 公众号

大晓机器人和南洋理工发布 PhysX-Omni,一个框架直接生成能进仿真器跑的 3D 物体

这篇推文本身因为微信环境验证没抓到正文,我只能根据标题和已有英文摘要来说。PhysX-Omni 是一个 3D 生成框架,特点是生成出来的模型不是只能看,而是直接带物理属性,能区分刚体、软体和带关节的物体,扔进仿真器就能跑。配套的数据集 PhysXVerse 有超过 8700 个物理 3D 资产,覆盖 2900 多个类别。对做机器人仿真的人来说,省掉了手...

推荐理由:标题说打通全链路,但正文没抓到,只能按摘要判断。PhysX-Omni 解决的是仿真资产从能看升级到能跑的问题,省掉了手动标物理属性的脏活。8700+ 资产和 2900+ 类别说明数据集有一定覆盖面,不过没披露资产质量、仿真精度和实际跑分,效果还得等模型放出来再看。大晓机器人和南洋理工的组合在机器人圈有认知度,但放到整个 AI 圈声量中等,所以卡在 featured 门槛上。

6月5日星期五

新智元 · 公众号

蔚蓝科技卖了2.5万台四足机器人,90%进了普通人家

蔚蓝科技的四足机器人已经卖出2.5万台,覆盖295个城市,其中家庭用户占了九成。他们新发布的BabyAlpha A3算力比上一代提升了1000倍,能在机器上直接跑一个70亿参数的大模型。不过正文因为环境异常没加载出来,具体的技术细节和价格信息暂时看不到。

推荐理由:HKR三项都过了:标题抓人,数据有料,话题踩在家庭机器人和端侧大模型的竞争神经上。不过正文因为环境异常没加载出来,技术细节和价格都看不到,信息主要来自公司单方面口径,不是独立验证的行业突破,所以放在featured的低位。

机器之心 · 公众号

东南大学和北大搞了个机器人精细操作评测框架,说传统只看成功率的办法会把能力高估七成

这篇推文本身被微信的环境验证挡住了,正文内容没抓到。从标题和已有的英文摘要看,MetaFine 是一个诊断式的元评测框架,专门拆开看机器人在精细操作上的理解、感知和行为三个环节,而不是只给一个“成功/失败”的二元结果。研究团队说,传统只看最终成功率的评测方式,对精细操作能力的评估会虚高最多 70%。具体怎么测的、用了哪些任务和模型,正文没披露,没法展开。

推荐理由:标题和摘要抛出的 70% 虚高数字很有冲击力,MetaFine 的三轴诊断思路也确实比只看成功率进了一步。但正文被微信环境验证挡住,具体任务、模型和实验细节全是缺口,没法核实。所以它是一篇有钩子、有新知但信息不完整的二次评论帖,放在 featured 门槛上刚好,不宜再拔高。

量子位 · 公众号

姚顺雨现身腾讯云大会,回应腾讯 AI 落后质疑

姚顺雨在腾讯云 AI 产业应用大会上说,混元 3 把预训练和强化学习的基础设施重做了一遍,数据和评估方式也换了,还把最强的后训练人员先调去改进元宝。他点名代码 agent、多模态和具身智能是腾讯接下来的重点方向。

推荐理由:这是一篇大会发言和路线图信号,不是带规格、跑分或上线日期的新模型发布。信息增量在于腾讯把后训练精锐先押在元宝上,以及重做基础设施这个表态,但缺少可验证的指标。放在 featured 低位,是因为它给中国大厂 AI 战略更新提供了一个有争议锚点的注脚,而不是一个硬核技术首发。

量子位 · 公众号

与其砸100亿做人形机器人,不如先让10万台机器狗进家庭

蔚蓝科技的BabyAlpha系列机器狗已经卖出25397台,其中九成是家庭用户买回去用的。他们最新的A3机型能在本地跑一个70亿参数的大模型,官方给出的推理速度是每秒280个token。不过正文因为环境验证问题没加载出来,具体配置、价格和实际体验细节暂时看不到。

推荐理由:HKR 三项都过:有明确的走访对象和销量数据,有端侧推理的具体指标,话题也切中中美算力差距和效率竞赛。但正文因为环境问题没加载出来,缺少配置、价格和实际体验细节,本质上还是一篇带有观点的产品进展评论,不是模型发布或平台级事件,所以放在 featured 档的偏上位置。

阮一峰的网络日志

中国 AI 大厂访问记

一群美国科技分析师在 5 月走访了 14 家中国 AI 和机器人公司,带回来一些观察。最核心的矛盾是算力:他们估算到 2025 年底,美国的 AI 算力大概是中国的 8 倍,中国公司能拿到的英伟达高端显卡数量比美国对手少一个数量级。但中国模型并没有因此落后几年,反而只差几个月,因为被芯片限制逼出来的计算效率很高——单位算力产出的智能是简单堆算力的 4 ...

推荐理由:这篇不是一手发布或产品大事件,属于实地走访的评论稿,但信息密度够高。我会先打个折:它引用的算力倍数和效率倍数来自分析师估算,正文没披露具体测算方法,这点先别太激动。不过它把芯片限制逼出来的工程取舍讲得很清楚——中国模型没落后几年,只差几个月,靠的是在有限显卡上榨出更高智能。对关注中美 AI 竞赛节奏的人来说,这比单纯喊安全口号有料。

AI HOT 精选

AGI 之后,还有什么东西是稀缺的?

Alex Imas 和 Phil Trammell 聊了一个很根本的问题:当机器人和 AI 能把大多数东西都造出来之后,经济里还有什么会保持稀缺。他们给出的核心判断是,只要人还在意“这件事是人做的”,那人的参与本身就变成了稀缺品。比如芭蕾舞表演、咖啡馆里的真人服务,机器可以复制一万个,但芭蕾舞演员的数量是固定的,这种“人给人服务”的体验就成了价值锚点。...

推荐理由:HKR 三项都站得住。H 强在用一个反直觉的例子把 AGI 后的稀缺性讲活了;K 有具体的筛查机制,但信息缺口明显——没量化、没法案细节,所以判断只能停在“机制成立但缺数据”上;R 切中安全监管和劳动力分工的焦虑。整体属于评论类文章,信息密度够但落地程度不足,放在 featured 档合理。

6月4日星期四

The Verge · AI

亚马逊给仓库机器人 Proteus 加了语音交互,工人可以直接用自然语言派活

亚马逊发布了新版 Proteus 仓库机器人,核心变化是工人不用再通过专用软件下指令,直接说话就能给它派任务,像跟同事沟通一样。Proteus 最早在 2022 年亮相,外形像个大号扫地机,负责在仓库里搬重货、推大车。这次升级主要是交互方式从代码/软件切到了自然语言,但正文没披露具体部署了多少台、单台成本多少,也没说语音指令在嘈杂仓库里的准确率怎么样。...

推荐理由:我会先打个折:Amazon 只说了 Proteus 能听懂人话,没给任何规模数据,所以重要性卡在 featured 门槛附近。亮点是交互方式从编程界面直接跳到口语对话,对一线工人上手门槛降得明显;但没披露部署量,效果和稳定性都还是未知数。如果是真的跑通了,省培训成本、提响应速度都说得通,这点先别太激动。

量子位 · 公众号

CVPR 2026 上,小鹏给英伟达、特斯拉和 Waymo 讲了一遍自己的物理 AI 技术栈

小鹏在 CVPR 2026 上公开了他们的世界模型技术栈,包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算,相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练,这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒,对实时驾驶决策来说这个...

推荐理由:我会先打个折,这毕竟是小鹏在顶会上的技术展示,不是独立验证过的第三方评测,所以分数没给到 85 以上。但选题确实抓人:CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI,本身就制造了对比。信息量也够,X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟,都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例,也没说 80 毫秒是平均还是 P99,这点先别太激动。整体看,对做自动驾驶和端侧模型的人有参考价值,也踩中了中美技术竞争的神经,所以放在 featured 位置。

6月3日星期三

NVIDIA 博客

NVIDIA 在 CVPR 发了三篇物理 AI 论文:抓取、自动驾驶和游戏里练出来的智能体

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。

机器之心 · 公众号

蚂蚁灵波在 RSS 2026 提出首个自回归因果世界模型,用 50 条演示数据就能让机器人学会通用操控

蚂蚁灵波和港科大搞了个叫 LingBot-VA 的模型,把“预测画面接下来怎么变”和“判断该做什么动作”合到一个自回归框架里。论文说,每个任务只用 50 条真实世界的演示数据微调,在 RoboTwin 2.0 的简单和困难设定下,成功率分别到了 92.0% 和 91.1%。不过原文因为微信环境异常没抓到,具体实验细节和泛化边界暂时看不到,这个成功率数字...

推荐理由:标题的“50条数据”是个强钩子,对数据成本敏感的从业者吸引力很大。文章把自回归因果世界模型的机制讲得比较清楚,就是让模型先预测画面变化再决定动作,不是黑箱。但全文只有一篇论文发布,没看到开源代码、实物测试视频或跟主流基线(比如扩散策略)的量化对比,验证强度不够。所以重要性给78,属于值得关注但别急着全信的研究发布。

量子位 · 公众号

大晓机器人和南洋理工搞了个统一物理3D生成框架,刚体、软体、带关节的物体都能一次搞定

这个框架叫PhysX-Omni,目标是让生成的3D模型直接能进物理仿真跑起来,不用再手动修。它把刚体、软体和关节体三类物体的生成统一到一个流程里,省掉了以前要分开处理的麻烦。配套的PhysXVerse数据集有8700个资产,覆盖2900个类别,规模不小。评测基准PhysX-Bench从几何、尺寸、材质、可交互性、运动学和文字描述六个维度打分,但正文没披...

推荐理由:统一物理 3D 生成这个钩子很清晰,数据集和评测基准的规模也给了实锤,对做机器人仿真的团队确实有用。不过正文没提开源、没提落地案例,也没说生成质量跟现有方案比到底好多少,所以分数先不打满,78 分合理。

6月2日星期二

机器之心 · 公众号

图灵奖得主 Sutton 新论文:AI 的下一步,得学会在行动中理解世界

这篇文章的正文被微信环境验证挡住了,实际内容没抓到。从标题和摘要看,Banafsheh Rafiee 和 Richard S. Sutton 提了一个叫“生成认知”的框架,给 AI 立了四根柱子:经验、感知与行动不可分、自主性、具身性。说白了就是主张智能不能光靠看数据,得在跟环境互动的过程中长出来。但具体怎么实现、有没有实验,正文没披露,这点先别太激动。

推荐理由:这篇是 Sutton 和 Rafiee 的新论文解读,核心是提出“生成认知”框架,主张智能体得靠经验、感知和行动绑在一起、自己定目标、还得有身体去试错。我会先打个折:正文没披露实验、代码或可复现的测试,目前还停在概念层。但 Sutton 的名气和四个支柱的提法,让它有资格进 featured,属于研究评论向的必读。

r/LocalLLaMA

NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型,能同时吃文字、图片、视频并生成视频、音频和动作指令

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face,这次发了两个尺寸:Nano 版 160 亿参数,Super 版 640 亿参数。它是个全模态世界模型,输入可以混着来——文字、图片、视频甚至动作轨迹都行,输出也不止视频,还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了,实际跑起来的硬件门槛...

推荐理由:我会先打个折:正文没披露 benchmark 分数、许可证和训练细节,所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上,这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说,输入支持动作轨迹、输出能直接给动作指令,说明它不只是生成漂亮画面,而是想往物理交互方向靠。这点先别太激动,因为没看到在真实机器人任务上的验证,但方向对,且开源降低了试错成本。

Latent Space

英伟达连发三弹:Cosmos 3 世界模型、Nemotron 3 Ultra 大模型,还有一台叫 Spark 的个人超算

英伟达在台北电脑展上放出了一波开源模型和硬件。Cosmos 3 是一个能同时处理文字、图片、视频、音频和动作的“世界模型”,用了混合 Transformer 架构,把负责推理和负责生成的两个模块拼在一起。它分 Nano(16B)和 Super(64B)两个尺寸,其中 Super 微调后的文生图和图生视频能力,在开放权重模型里直接冲到了第一。Nemotr...

推荐理由:这次发布把视觉世界模型、大语言模型和本地推理硬件捆在一起推,信息密度高。Cosmos 3 的 MoT 架构和两个具体尺寸(16B/64B)给了明确的技术锚点,Nemotron 3 Ultra 的 550B-A55B 开放权重对想自己部署大模型的人是个实在消息。不过正文没给出具体 benchmark 对比或价格,实际效果和性价比还得等上手。整体影响面广,但还没到前沿实验室发新基础模型那种震动级别。

6月1日星期一

AI HOT 精选

NVIDIA 开源 Cosmos 3:一个模型搞定物理世界的看、想、动

NVIDIA 在 GTC Taipei 把 Cosmos 3 完全开源了,模型权重、代码和数据集都放了出来。它被叫做首个物理 AI 全能模型,意思是能直接看懂真实世界、预测接下来会发生什么,并给出机器人该做的动作。这次发了两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提具体跑分和硬件门槛,实际部署成本还得自己测。

推荐理由:HKR 三项都成立:钩子是 NVIDIA 开源物理 AI 模型,知识增量是 32B/8B 双版本加全套开放物料,受众是机器人、仿真方向的从业者。正文信息很薄,没给基准测试、没提许可证细节,所以分数压在 78–84 区间,不往上拔。

机器之心 · 公众号

OpenAI 为机器人团队招兵买马,由 Sora 负责人带队,部分岗位底薪开到 34 万美元以上

OpenAI 放出了十多个旧金山的机器人岗位,团队由 Sora 的负责人 Aditya Ramesh 带队,是从他之前的 Worldsim 项目演变过来的。其中执行器设计工程师的底薪现金在 34.2 万到 44.5 万美元之间,另外还有 PPU 激励。不过原文因为微信环境异常,具体岗位职责和团队规模都没披露,只能看到招聘信息的大致框架。

推荐理由:这条消息有明确的团队、负责人和薪资数字,不是模型或产品发布,但作为招聘信号已经够硬。我会先打个折:目前只是招人阶段,离实际产品还有距离,这点先别太激动。不过 OpenAI 把机器人当成全栈方向来做,薪酬又直接对标顶级硬件人才,对同行抢人和行业风向都有参考价值,所以放在 featured 档位没问题。

机器之心 · 公众号

VAST 发布 Project Eden,世界模型第一次能像游戏一样“存档”了

VAST 推出了一个叫 Project Eden 的三层世界模型架构,把场景的持久状态和画面渲染拆开了。简单说,就是给 AI 生成的 3D 世界加了个“存档”功能,你改过的东西下次打开还在,不用每次都重新生成。文章还提到 VAST 在 A+ 和 A++ 轮一共融了将近 2 亿美元。不过正文因为微信页面环境异常被屏蔽了,具体技术细节和效果演示都没看到,这...

推荐理由:我会先打个折:VAST 不是一线基础模型实验室,正文也没披露具体基准测试结果或开放接入方式,所以分数落在 78–84 区间。但 Project Eden 把世界状态推演和视觉渲染拆成三层,还给了“存档”这个产品钩子,加上近 2 亿美元的融资规模,对关注仿真基础设施的从业者来说信息量够硬。

量子位 · 公众号

招商局狮子山实验室开源 LiOS 架构,把云端大模型延迟压到 30 毫秒,还送了个叠衣服数据集

招商局狮子山人工智能实验室放出了一个叫 LiOS 的边云架构,专门解决机器人怎么用上云端大模型的问题。他们跨机器测下来,从本地摄像头到云端 GPU 显存,单向延迟大约 30 毫秒,这个数字对很多实时控制场景已经够用了。架构里低延迟视频传输模块直接开源,还附带了一个 LeFold 叠衣服数据集。不过正文因为微信环境异常没加载出来,具体用了什么模型、在哪些...

推荐理由:我会先打个折:招商局狮子山实验室不是头部平台,也没看到多源交叉验证,所以影响力止步中等。但这条消息确实给了干货——30ms相机到云端显存的延迟数字,说明端云协同在物理世界干活有戏,不是纯画饼。开源图传模块和叠衣数据集也算实在,同行能直接拿来测。正文没披露具体模型规模、功耗和复杂场景下的抖动,这点先别太激动。

量子位 · 公众号

VAST 拿了近 2 亿美元,首次公开世界模型 Eden 的技术路线

VAST 在 A+ 和 A++ 轮融了近 2 亿美元,同时公布了 Project Eden 世界模型的架构。这套架构把“世界状态怎么变”和“画面怎么渲染”拆开了:先有一个结构化的状态层来推演变化,中间加一层条件接口做翻译,最后再用生成式渲染层出图。正文没披露具体估值、投资方和模型落地时间表,技术细节也只给了三层框架,没有实验数据和验证指标。

推荐理由:VAST拿了近2亿美元A+和A++轮,同时把Project Eden的三层架构亮出来:状态层管世界推演,条件接口层接外部输入,生成式渲染层负责最终画面。这个拆法让世界模型不再是一团黑盒,对做3D和具身智能的人有启发。不过正文没给出任何量化指标、开源时间或实际跑通的场景,所以我会先打个折,不往顶格推。

AI HOT 精选

Runway 与 NVIDIA 联手搞了个 Cosmos Coalition,要一起做开放的世界模型

Runway 宣布以创始成员身份加入 Cosmos Coalition,跟 NVIDIA 和一批头部 AI 实验室搭伙,目标是共建并开源面向物理 AI 的前沿世界模型。第一个项目是 Runway 和 NVIDIA 联合开发的一个基础模型。世界模型说白了就是让 AI 能理解物理规律、预测下一步会发生什么、并据此行动,Runway 说这是他们从第一天就在押...

推荐理由:我会先打个折:正文只给了个标题和一句话摘要,没披露模型规模、训练数据、许可证和任何跑分,所以没法判断实际能力。但 Runway 加 NVIDIA 这个组合,加上“开源物理世界模型”这个定位,确实戳中了机器人、具身智能那帮人现在最头疼的事——没有好用的开源基础模型。这点先别太激动,等他们把模型和协议放出来再看。

AI HOT 精选

英伟达开源 Cosmos 3:一个能看懂物理世界、还能生成动作的 32B 模型

英伟达把 Cosmos 3 称为第一个完全开放的物理 AI 全能模型,意思是它不只能识别图像,还内置了视觉推理、生成 3D 世界状态和直接输出动作的能力。这次放出两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提训练数据规模、具体跑分和推理成本,所以实际能用多好、跑起来贵不贵还得等实测。

推荐理由:我会先打个折:正文是单篇发布稿,没给基准测试、没提许可证细节,也没说训练数据规模和实际部署条件,所以分数卡在 78–84 区间。亮点在于 NVIDIA 第一次把视觉推理、世界生成和动作生成打包成一个开放物理 AI 模型,并给出两个具体尺寸,这对机器人圈子的信号意义不小。但缺少验证信息,这点先别太激动。

AI HOT 精选

MWC26 上海要办人形机器人点球大战,宇树科技等 8 支队伍上场,全程自主、不靠遥控

GSMA 宣布在 2026 年 6 月 24 日至 25 日的 MWC 上海搞一场人形机器人点球比赛,这是全球头一回。8 支国内具身智能团队参加,包括宇树科技、灵心巧手等。规则参照世界杯点球,双方各罚 5 轮,射门和守门的都是机器人,平局后一球定胜负。关键限制是机器人必须自己识别球和守门员位置、决定射门角度并控制发力,不能由人遥控,也不能跑预设脚本。这...

推荐理由:我会先打个折:这是活动预告,不是模型发布或可复现的测试结果,所以分数压在 72–77 之间。但选题本身够抓人,规则里“不许遥控、不许脚本”把门槛拉高了,不再是展台走秀。正文没披露具体评分标准、场地条件和机器人硬件细节,所以别急着当技术里程碑看。如果现场真能稳定自主对抗,那才算数。

AI HOT 精选

OpenAI 成立机器人团队,由 Aditya Ramesh 带队,正在招硬件和系统工程师

OpenAI 发推宣布正式组建机器人团队,由 Aditya Ramesh 负责,目前开放全栈硬件、系统和 ML 工程师岗位。团队方向是软硬件协同设计,短期先帮技术工人干活,远期想给每个人配一台个人机器人。推文没写招聘规模和具体时间表,也没提预算或产品形态,我会先打个折——这更像是一个组队信号,离实际产品还有距离。

推荐理由:OpenAI 把机器人团队和负责人亮出来,是个明确的路线信号,所以 H/K/R 都成立。但产品形态、时间表和招聘规模正文都没提,我会先打个折,不放到 P1。

5月31日星期日

新智元 · 公众号

复旦系团队发布时空一体世界动作模型 STI-WM,称能同时吃进 RGB、点云和本体感知数据做百秒级任务规划

这篇文章来自微信公众号,但页面被环境验证挡住了,正文内容完全看不到。标题和摘要里提到的“复旦铁三角”和“最优物理 AI 路径”都是原文的说法,具体技术细节、实验数据和模型架构都没法核实。已知信息是:一个叫 STI-WM 的模型,主打时空一体的世界动作建模,用在机器人上,支持 RGB 图像、点云和机器人自身状态感知三种输入,能做上百秒的任务规划。另外还提...

推荐理由:这篇东西我会先打个折——全是公司自己说的,没给公开 benchmark 也没说模型能不能复现。但信息量确实不小:STI-WM 把视觉、点云和机器人自身状态揉进一个模型里,号称一次能规划上百秒的动作,这比现在多数 demo 里几秒的规划长得多。半年融了 5 轮、Pre-A 轮 3 个亿,还拉了 NVIDIA 站台,资本侧的信号比技术侧更实。对做机器人落地的人,这条至少能看出一条技术路线和资源密度,所以放在 featured 门槛上。

量子位 · 公众号

复旦系团队发布机器人世界动作模型 STI-WM,把时空信息揉在一起做长任务

沐神智能搞了个叫 STI-WM 的模型,专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态(比如关节角度)同时喂进去,首创了时空一体的架构,不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演,中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数,也没提部署成本,所以实际效果和性价比还得等更多数据。

推荐理由:我会先打个折:正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的,这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构,直接做百秒级推演,这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队,英伟达也出现在标签里,产业和学术两边都有点关联。综合来看,信息够新、够具体,但验证强度不明,所以放在 featured 门槛附近,不往上拔。

AI HOT 精选

特斯拉 FSD V14.3.3 用 4 天 21 小时横穿加拿大,6051 公里全程没让人碰方向盘

一群电动车爱好者开着搭载 FSD V14.3.3 的特斯拉,从温哥华一路跑到哈利法克斯,6051 公里零接管、零退出。变道、过施工路段、甚至每次进超充站自动倒车泊车,全是系统自己干的。这个版本放宽了对驾驶员盯路的判定,长途开下来没那么累。不过得说清楚,这仍是 L2 级辅助驾驶,法规上要求人随时准备接管。正文没提途中遇到的极端天气具体有多糟,也没交代是否...

推荐理由:我会先打个折:这是特斯拉自己放出来的单次行程,没有第三方验证,也没说清路线里高速和城市比例、天气变化、有没有施工路段这些容易翻车的细节。但 6051 公里零干预这个数字本身够硬,版本号也明确,对从业者来说是个可复现可质疑的靶子。分数停在 82 是因为它给了结果却没给边界条件,没法判断这到底是常态水平还是挑了个好天气跑出来的。

5月30日星期六

FT · 科技

英国军方考虑允许 AI 自主发动致命打击,不再需要人类批准

FT 这篇报道的标题很炸,但正文被付费墙挡住了,只看到订阅页面。标题说英国军方正在研究让武器系统在没有人类批准的情况下执行致命打击。具体是哪种武器、在什么条件下可以自主开火、法律框架怎么搭、有没有时间表,这些关键信息正文都没披露。光看标题,这更像是一个政策方向的试探,离真正部署还远,先别太激动。

推荐理由:FT 标题抛出一个很猛的判断,但点进去只有订阅提示,等于只给了一个概念,没给任何能验证的细节。我会先打个折:话题性够强,能让人立刻意识到“人在回路”这条底线正在被试探,所以重要性和传播力都高。但信息缺口太大,没法判断这是政策试探、技术验证还是媒体标题操作,这点先别太激动。