跳到正文

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精选

第 81–100 条 · 共 167 条

5月27日星期三

机器之心 · 公众号

三星公开 Meki、M2RL 和 LiveClawBench 三项研究,从端侧记忆架构做到物理 AI 评测

三星这次放出了三个项目:Meki 是一种给端侧模型用的记忆架构,让手机或 IoT 设备上的小模型能记住上下文、省着用算力;M2RL 是多领域强化学习框架,想让一个模型在不同任务里都能自己学会干活;LiveClawBench 则是专门测物理 AI 的基准,看模型能不能在真实世界里抓取、操作物体。文章还提到三星已经采购了数万张 GPU 来搭 AI 基础设施...

推荐理由:这是一组三星研究院的技术打包发布,不是旗舰模型或产品上线,但胜在信息具体、方向明确。我会先打个折:正文没披露数万张 GPU 的具体型号和部署时间线,也没说 Meki 在端侧实测的延迟和功耗,所以不能当量产信号看。不过,三星把 Memory 架构、多领域 RL 和灵巧手评测一起端出来,等于公开了自己在 Physical AI 上的三条腿走路策略,对关注端侧和机器人方向的从业者来说,比单篇论文更有参考价值。

AI HOT 精选

Reachy Mini 机器人现在能完全在本地跑语音对话了

Hugging Face 给 Reachy Mini 机器人配了一套纯本地运行的语音对话方案,数据不用上传云端。他们用 speech-to-speech 库搭了一条流水线:先靠 Silero VAD 检测有没有人在说话,再用 Parakeet-TDT 把语音转成文字,接着交给大模型想怎么回,最后让 Qwen3-TTS 把文字念出来。这套东西通过一个兼容...

推荐理由:HKR 三项都成立:有个清晰的本地机器人语音钩子,技术栈细节给得实在,对边缘端语音代理场景有直接吸引力。范围就限定在 Reachy Mini 的语音交互上,所以放在 featured 档。

5月26日星期二

纽约时报中文网

中美共同的 AI 焦虑:怕被未来收割

作者在中美两头跑,发现两边的普通人都在被同一种不安笼罩:技术跑太快,红利不一定轮到自己。文章用滴滴司机钻算法空子、美国送餐员抢单的例子开场,指出 AI 在两国都加剧了职场监控、情感孤独和无力感。美国超七成青少年拿聊天机器人当陪伴,中国预计到 2030 年独居人口达 2 亿,AI 伴侣成了孤独的速效解药。科技精英忙着追逐风口和 AGI,普通人却用“社畜”...

推荐理由:这篇不是产品发布或模型论文,是一篇评论,但两个社会数据点和一个中美对照的框架让它有信息量。我会先打个折,因为正文没披露具体调查方法和样本量,数字的可靠性没法验证。不过它把技术趋势和人的孤独感直接挂钩,对从业者理解应用场景有启发,放在 featured 里当一篇有观点的解读是合适的。

5月25日星期一

机器之心 · 公众号

众趣科技开源浏览器端3D高斯泼溅查看器,10亿个高斯点也能跑,内存和速度都比李飞飞团队的Spark 2.0强

众趣科技把他们的Aholo Viewer开源了,这是一个在浏览器里直接看3D高斯泼溅场景的工具。在300万个高斯点的测试里,它占用的内存只有Spark 2.0的一半,加载速度快了一倍,渲染速度快了两倍,而且宣称能撑住10亿个高斯点的场景。不过正文因为环境验证没抓到具体技术细节,我会先打个折:实际效果得自己跑一下才知道,但光看这几个数字,在网页端做大规模...

推荐理由:这条消息我会打个80分。群核科技这次开源的不是基础模型,而是一个3D渲染工具,但“10亿高斯点塞进浏览器”这个钩子很直观,性能对比也给了具体数字,不是空口说快。对从业者来说,浏览器端能跑这种量级的场景,部署上确实省事省钱。不过正文没披露10亿点场景的具体交互帧率,这点先别太激动,等他们后续补数据。

5月22日星期五

AI HOT 精选

国家发改委:建训练基础设施,让机器人从跑马拉松到进工厂商场家庭

国家发改委在5月22日的发布会上,用北京亦庄人形机器人半马的成绩来说明具身智能的进步:参赛队伍从20多支涨到100多支,完赛队伍从6支涨到40多支,机器人跑得更快、过弯更灵活、导航更自主。下一步会重点建两样东西:一是训练基础设施,用来采集数据和训练机器人的“大脑”和“小脑”模型,让它在不同场景都能干活;二是应用中试基地,把软硬件生态和训练设施打通,加速...

推荐理由:这条政策指向很明确,就是要让机器人走出比赛场景,进到真实环境里干活。队伍和完赛数量的增长是实打实的进步,但正文没披露训练基础设施和中试基地的具体预算、时间表和规模,所以实际推进速度还得看后续落地细节。

机器之心 · 公众号

CVPR 2026 | HiF-VLA:用视频压缩的思路教机器人“边看动作边想下一步”

西湖大学团队搞了个叫 HiF-VLA 的框架,核心想法是把机器人看世界的方式从“一帧帧静态图”换成“画面怎么动的”。它直接用 H.264 这类视频编码器从画面里提取紧凑的运动向量,再让一个联合专家模型同时预测未来的视觉动态和该做的动作序列。论文里给的数据是,在设定的历史窗口下,显存峰值 31.4GB,延迟 117.7 毫秒。不过正文因为环境验证问题没加...

推荐理由:这篇 HiF-VLA 我会先打个折:它还是一个单篇研究,没有落地案例或多方交叉验证,所以放在 featured 低位。但它的思路确实比多数 VLA 论文更“省”——直接用 H.264 运动向量代替逐帧视觉编码,把“看变化”和“想动作”塞进联合专家里一起算,显存压到 31.4GB、延迟 117.7ms,对想在真机上跑实时推理的团队是个可参考的方向。正文没披露在真实机械臂上的成功率或与主流 VLA 的 head-to-head 对比,这点先别太激动。

彭博科技

Waymo 在亚特兰大暂停无人出租车,因为车辆会往洪水里开

Waymo 在亚特兰大的一辆车直接开进了被淹路段,导致公司暂停了五个城市的服务。问题出在车辆对积水路面的识别和决策上——它判断不出“水有多深、能不能过”,就硬着头皮往前开。这跟之前导致数千辆车被召回的是同一个毛病。不过正文没披露具体是哪五个城市,也没说什么时候恢复运营。

推荐理由:我会先打个折:正文没披露具体是哪五个城市、也没说什么时候恢复,所以影响范围还看不清。但 Waymo 作为头部的 robotaxi 玩家,因为积水这种真实路况直接触发数千辆车召回并暂停多城服务,说明物理世界的安全边界比实验室难控得多。这点先别太激动,但确实暴露了无人车在恶劣天气下大规模运营的脆弱性,对行业信心是个实在的磕碰。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

AI HOT 精选

FSD 官宣进入中国大陆,但没公布城市、车型和价格

特斯拉发了一条很短的官宣,说 FSD 正式进入中国大陆市场。正文没披露哪些城市能用、支持什么车型、怎么收费,也没提监管审批情况。目前只有一句话,我会先打个折,等具体落地细节出来再看。

推荐理由:我会先打个折:这条消息本身很短,就是一句“官宣进入大陆”,所以重要性更多来自 FSD 进中国这件事本身,而不是正文给了多少料。H 和 R 都成立——市场等这个落地等了很久,而且它确实会搅动自动驾驶圈的监管和竞争话题。K 不成立,因为正文没披露任何落地范围、定价或审批细节,没法当干货用。

5月20日星期三

新智元 · 公众号

摩尔线程 MUSA 生态更新:SDK 对齐 CUDA 12.8,SGLang 主线已合并

摩尔线程放出了自家 GPU 生态 MUSA 的最新进展。SDK 5.1.0 把兼容目标拉到了 CUDA 12.8,覆盖了 761 个驱动和运行时接口,意思是跑 CUDA 代码时能认的指令更多了。推理框架 SGLang 的主线代码已经合并了 MUSA 的支持,硬件支持排期在 2026 年第二季度。另外还提了一个叫 MUSACODE 的工具,能自动把库迁移...

推荐理由:我会先打个折:这还是一家厂商的生态更新,不是整个国产 GPU 阵营的集体突破。但文章把兼容 API 数量、SDK 版本对标和 SGLang 主线合入这几个点都摆出来了,比空谈“替代 CUDA”实在。老黄喝豆汁的梗让标题有了传播力,内文也没写成公关稿,对关注推理部署和算力自主的读者来说值得一看。

新智元 · 公众号

驭势科技在港交所上市,成为全场景L4自动驾驶第一股,市值超百亿港元

驭势科技今天在港交所挂牌,发行价每股60.30港元,公开发售部分超额认购6777倍。公司主要做机场、厂区这类封闭场景的L4级无人驾驶物流车和接驳车,2025年在大中华区机场L4商用车市场占了90.5%的份额。不过原文因为微信环境验证拦截,正文内容没抓到,具体的财务数据、技术路线和募资用途都没披露,这些关键信息得去翻招股书才能确认。

推荐理由:驭势科技港股上市,机场 L4 商用车市占率做到九成,公开发售被抢了六千多倍,说明市场对自动驾驶商业化这条路的买单意愿很强。不过正文没披露营收和盈利情况,光看市占率还判断不了生意本身赚不赚钱,这点先别太激动。

纽约时报中文网

中国法院第三次判企业用 AI 替代员工后辞退违法,杭州案月薪从 2.5 万降到 1.5 万被认定非法解雇

杭州中院把一起 AI 替代岗位的案子定为指导性案例:公司用 AI 取代质检岗,给员工调岗但月薪从 2.5 万砍到 1.5 万,员工拒绝后被辞退,法院认定公司没做合理安置,属于违法辞退。这是中国官方第三次公开支持被 AI 抢走工作的劳动者胜诉,信号很明确——企业引入 AI 算自愿降本,不能当裁员的理由。文章提到中国青年失业率约 17%,超 2 亿人在零工...

推荐理由:这篇 NYT 报道把中国 AI 政策与劳动仲裁案例绑在一起讲,杭州案的数字和判决理由都写清楚了。它不是模型发布或产品动态,所以重要性给 80、放在 featured 比当天必写更合适。我会先打个折:正文没披露企业名称和具体行业,但三个公开判例的累积信号已经够强,值得让从业者看到政策与法院之间的拉扯。

TechCrunch · AI

Google 把街景塞进 Genie 世界模型,现在能直接生成可交互的街道模拟

Google DeepMind 把 Street View 街景数据接入了自家的世界模型 Project Genie,让它能根据真实街道照片生成可交互的 3D 场景。你可以像玩游戏一样在模拟街道里走动,还能调天气、看极端气候下的样子。官方说这会用在机器人训练、游戏和旅游场景里,但正文没披露模型参数、上线时间,也没给任何评测结果,所以实际效果和成本都还是...

推荐理由:谷歌 DeepMind 把 Street View 塞进 Project Genie,等于让街景从静态照片变成能走进去互动的模拟环境。我会先打个折:正文完全没披露模型大小、推理延迟、上线计划,也没给任何定量评测,所以现在只能当一次技术演示看。但它的钩子很实在——机器人训练可以直接用真实街景做仿真,游戏生成也能拿到现成的地图素材,再加上谷歌手里独一份的街景数据,这个方向本身值得关注。

5月19日星期二

AI HOT 精选

现代汽车计划在自家工厂部署 2.5 万台波士顿动力 Atlas 人形机器人

现代汽车集团在摩根大通的投资者会上说,要在现代和起亚的制造工厂里用上超过 2.5 万台 Atlas 人形机器人,目标到 2028 年实现年产 3 万台。执行器(相当于机器人的关节和肌肉)会在美国工厂生产,规划年产能超过 30 万个。不过正文没披露具体什么时候开始铺、铺到哪些工厂,也没说采购成本。

推荐理由:这条消息就一句话:现代汽车要搞 2.5 万台 Atlas。数字够大,所以能上推荐位。但我会先打个折,因为正文没披露部署时间、场景和采购条件,等于只给了一个量级,没有落地信息。如果是真的,这个采购规模挺省钱也够吓人,但这点先别太激动,等具体方案出来再看。

AI HOT 精选

地平线开源了 4 亿参数的机器人控制模型 HoloMotion-1,能跳舞、搬箱子,端侧跑到 300 帧

地平线机器人实验室把一个人形机器人全身控制模型 HoloMotion-1 开源了,参数规模 4 亿,他们管它叫“机器人小脑”。这个模型用了 MoE 稀疏激活和 KV-cache 推理,把单步推理开销压下来,在端侧能跑到约 300FPS,比常见的 50Hz 控制频率高出一大截。训练数据来源比较杂,包括互联网视频、光学动捕、VR 遥操作和惯性动捕,经过统一...

推荐理由:HoloMotion-1 是一个开源机器人控制模型,4 亿参数能在端侧跑到约 300FPS,对做具身智能的团队来说是个可复现的参考。不过目前只看到动作生成能力,正文没披露在真实机器人上的成功率或延迟数据,实际部署效果还得等后续验证。整体偏技术发布,影响力集中在机器人圈子,放在 featured 档位合适。

量子位 · 公众号

摩尔线程发布国产全栈具身智能仿真平台,机器狗“小飞”全程在自家 GPU 上完成训练

摩尔线程推出了 MT Lambda 仿真平台,把物理引擎、渲染和 AI 模型训练整合到一起,用自家的 GPU 跑通了从模拟到真机的完整流程。现场演示的机器狗“小飞”在仿真里学会走路后,直接迁移到实物上就能跑。不过正文因为需要验证码没能完整抓取,具体的技术参数、训练时长和成功率数据都没披露,这点先别太激动。

推荐理由:我会先打个折:性能、定价、开放方式和第三方验证正文都没给,所以重要性只能停在 featured 低位。但这条消息本身信息量够——摩尔线程拿出的是一个国产 GPU 驱动的具身仿真方案,不是纯软件缝合,而且用机器狗“小飞”做了 100% 仿真训练到真机迁移的 demo,说明链路至少跑通了。对国内做机器人、做仿真的人来说,这相当于多了一个可能绕开 NVIDIA 生态的选项,哪怕现在还很早期,也值得标记一下。

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

AI HOT 精选

百度核心 AI 业务 Q1 营收超 136 亿元,首次占通用业务收入过半

百度发了 2026 年 Q1 数据,核心 AI 驱动业务收入超过 136 亿元人民币,同比增长 49%,连续多个季度在涨。这个数字第一次超过百度通用业务收入的一半,说明 AI 相关收入已经从“添头”变成了主力。增长主要来自 AI 云基础设施、AI 应用和自动驾驶出行平台 Apollo Go。完整财报链接在原文里,正文没拆开各板块的具体数字,所以没法判断...

推荐理由:这条是百度自己发的财报口径,只给了总收入数字和占比,没拆各块业务(比如智能云、Apollo Go)各自贡献多少,也没提利润率。所以“AI 收入过半”这个结论先打个折——它更像一个对外叙事信号,而不是一份能细拆的账本。对从业者来说,知道百度 AI 商业化在加速就够了,但别拿这个数字直接对标其他厂的收入结构。

Latent Space

无人机自主技术栈与经济学:从宠物摄像头到 AI 制导炸弹

Yaroslav Azhnyuk 是 The Fourth Law 的创始人,这家公司做 AI 制导无人机。他之前创办了 Petcube,卖的是给宠物扔零食的摄像头,现在做的是给占领军扔炸药的摄像头。这期播客他和 Noah Smith 聊了两个小时,核心是 FPV 穿越机怎么成了战场上的新杀器——前线 70% 到 80% 的伤亡都是它造成的。他提出无人...

推荐理由:这是一期播客对谈,不是产品发布或论文,所以别当硬核技术报告看。我会先打个折:它给的是行业判断和框架,不是实测数据。但聊得挺实在,把无人机从遥控到全自主拆成了5个等级,又用8个维度讲战场怎么用、成本怎么算,还专门分析了中国制造为什么能把价格打下来。对想快速理解无人机产业和自主化路线的人,这期信息密度够,值得放进精选。

5月17日星期日

量子位 · 公众号

一只机器狗,把英伟达的算力王座拱翻了

蔚蓝科技发了款消费级机器狗 BabyAlpha A3,用六颗芯片搭了个异构计算集群,直接在本地跑 7B 参数的大模型,推理速度到 280 TPS。视觉上配了 6600 万像素的摄像头,每秒能扫出 223.2 万个点云数据点,计划第三季度上市。不过正文因为环境验证没抓到具体内容,上面这些数字都来自外部摘要,实际表现和定价还没法核实。

推荐理由:我会先打个折:正文是单篇产品发布稿,没披露功耗、价格和对比基准,所以别太激动。但这条消息确实有料——蔚蓝科技在机器狗里塞了6颗芯片搭异构集群,本地跑70亿参数模型,推理速度标到280TPS,Q3就要上市。对做端侧部署和机器人的人来说,这等于给“离了英伟达行不行”提供了一个实物样本。信息缺口也很明显:没写具体芯片型号、没给功耗数据、没说明280TPS是在什么精度和batch size下测的,这些都会影响实际可用性。综合来看,角度抓人、事实具体、但验证信息不足,放在featured门槛上刚好。