跳到正文

#具身智能

今日 2 条

5月30日星期六

机器之心 · 公众号

英伟达和清华的 γ-World 把世界模型从单机改成了联机,登顶 HuggingFace 日榜

这篇推文本身因为微信环境验证没抓到正文,我只能根据已有的英文摘要和标题来还原。γ-World 是一个多智能体世界模型,核心是把多个 AI 角色放在同一个虚拟环境里互动。它用了一种叫“单纯形位置编码”的方法和 hub token 机制,把多个智能体之间的交互计算成本从平方级降到了线性级。说人话就是:以前每加一个角色,系统要算它和所有其他角色的关系,开销涨...

推荐理由:我会先打个折:这是研究发布,还没看到大规模落地验证,但技术点够具体。Gamma-World 解决的是多个 AI 同时在一个世界里交互时计算量爆炸的问题,用正单纯形位置编码让每个智能体知道彼此位置,再靠 hub token 汇总信息,把原本 O(n²) 的复杂度压到 O(n)。8 个玩家延迟压到 4.5ms 这个数挺实在,说明小规模场景已经能跑顺。不过正文没披露更多玩家数下的表现,这点先别太激动。整体属于有干货、有数字、方向对路的研究,给 featured 合理。

The Verge · AI

想拍你干家务,AI 公司开始用免费保洁换训练数据

一家叫 Shift 的 AI 训练初创公司说,可以免费给纽约人打扫房子,条件是允许他们拍摄保洁员干活的全过程:洗碗、擦台面、掸灰、拖地。这些视频会被用来训练家用机器人。公司还计划扩展到伦敦等城市。但正文没披露用户隐私条款、数据保留期限、后续收费模式,也没说具体什么时候进新城市。我会先打个折:免费保洁听着不错,但等于拿你家当机器人训练场,值不值得自己掂量。

推荐理由:我会先打个折:正文没披露视频拍到什么程度、数据保留多久、会不会扩到别的城市,所以别急着说这是机器人数据的灵丹妙药。但 Shift 这个做法确实戳到了一个真问题——教机器人做家务,缺的就是人在真实厨房里刷碗擦台面的视频。用免费保洁来换,比花钱买数据便宜,也比实验室摆拍更像真活。对从业者来说,看点在于这种采集方式能不能规模化,以及用户到底愿不愿意让陌生人架着相机看自己家。这点先别太激动,等他们公布授权条款和隐私处理再说。

5月29日星期五

The Verge · AI

Shift 用免费上门打扫换机器人训练数据,清洁工会全程被录像

一家叫 Shift 的 AI 训练数据公司说,可以免费帮你打扫家里,条件是让他们录下清洁工擦窗、吸尘、整理的全过程,拿这些视频去训练机器人。他们觉得这些数据的价值足够覆盖服务成本,网站上写的是“你得到干净屋子,我们拿到训练数据,双赢”。宣传片里清洁工戴着一顶有点奇怪的帽子干活。不过正文没提服务覆盖哪些城市、怎么处理隐私和知情同意,也没说已经收集了多少数...

推荐理由:HKR-H 和 HKR-R 都很实在:Shift 把家政服务直接变成机器人数据采集管道,话题性够强。HKR-K 有明确机制,但城市范围、隐私条款、数据集规模正文都没披露,所以先别太激动,暂时放在低曝光位。

AI HOT 精选

特斯拉说 FSD 比人安全十倍,但训练它的员工自己都不敢坐

路透社扒了特斯拉的安全报告,发现“比人类安全 10 倍”这个说法站不住脚。特斯拉拿自己车气囊弹出的数据,去跟全美所有车辆(包括老车)的普通事故率比,11 位交通安全研究员看了直摇头,说这是误导性营销。更扎心的是,9 名前数据标注员和 1 名前工程师爆料,FSD 连避让校车、紧急车辆这种基础操作都还搞不定。为了给投资人看的自动驾驶出租车演示,员工得提前加...

推荐理由:这篇的核心冲突很清楚:特斯拉拿自己的 FSD 事故数据跟全美平均比,得出 10 倍安全的结论,但路透找的 11 位研究员认为这个比法不公平,因为联邦数据里包含大量老旧车型、非自动驾驶场景,统计口径不一样。我会先打个折——文章没给出特斯拉的具体计算方法和原始数据,所以没法验证 10 倍到底水不水,只能确认学界在公开质疑。对从业者来说,这提醒我们看厂商安全报告时要盯紧对比基准,别被单一倍数带着走。

5月28日星期四

NVIDIA 博客

NVIDIA 在 ICRA 发了 8 篇论文,核心是让机器人在仿真里练完直接去现实世界干活

NVIDIA Research 在 ICRA 上展示了 8 篇论文,都围绕一个思路:在仿真里训练机器人,然后直接部署到真实环境。ScheduleStream 让多机械臂并行规划,速度提升 3 倍,代码已开源。COMPASS 导航框架完全不靠真实数据,在仿真里训练后迁移到真机,20 次真实导航测试成功率约 80%,比纯模仿学习基线高了 4.5 倍。Gra...

推荐理由:我会先打个折:这些成功率都是在论文设定的场景里跑出来的,换到更乱的现场不一定能复现。但 8 篇论文同时给出实机数据,而且不是零星的几次测试,ScheduleStream 的 3 倍提速和 COMPASS 的 20 次导航约 80% 成功,至少说明 sim-to-real 的 gap 在可控缩小。对正在纠结仿真训练能不能落地的团队,这组结果比纯讲架构有说服力。

AI HOT 精选

Mistral 推出物理 AI 模型,用一张 GPU 几秒钟预测完整物理场

Mistral 整合了 Emmi AI 团队,发布了一个面向工业工程的物理 AI 基础模型。它能根据几何结构、边界条件或测量数据,在单张 GPU 上用几秒钟预测出完整的物理场(比如温度、应力分布)。正文没披露具体架构、参数量、训练数据规模和实测误差范围,也没给出跟传统数值仿真在精度和速度上的量化对比,所以实际工程可用性还得看后续验证。

推荐理由:Mistral 这次没发新聊天模型,而是直接拿下一个物理 AI 团队,做工业仿真。我会先打个折:正文没披露具体模型名、基准测试、定价和开放方式,所以没法判断它比现有求解器到底准不准、省多少。但方向本身值得关注——如果单 GPU 秒级出完整物理场是真的,对西门子能源这类重工业客户来说,仿真迭代速度会快很多,成本也可能降一截。这点先别太激动,等他们放出可复现的结果再说。

机器之心 · 公众号

ICML 2026:AutoMoT 用大小模型异步分工,在 Bench2Drive 和 nuScenes 上拿了双料第一

这篇文章本身被微信环境验证挡住了,正文内容没抓到,所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型,核心思路是把视觉语言模型和驾驶动作拆成两个专家:一个 4B 的 Qwen3-VL 负责看懂场景,一个 1.6B 的动作专家负责输出驾驶指令,而且两个模型是异步推理的,不用互相等。在...

推荐理由:我会先打个折:双 SOTA 听着唬人,但正文没披露 nuScenes 的具体指标,只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理,大模型负责想、小模型负责开,不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策,1.6B 的 AE 执行,这个组合在算力上挺省。不过论文没提实车验证,纯仿真成绩,这点先别太激动。整体看,对做自动驾驶算法的人有参考价值,但离出圈还差一口气,所以放在 featured 而不是更高一档。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。

5月27日星期三

机器之心 · 公众号

三星公开 Meki、M2RL 和 LiveClawBench 三项研究,从端侧记忆架构做到物理 AI 评测

三星这次放出了三个项目:Meki 是一种给端侧模型用的记忆架构,让手机或 IoT 设备上的小模型能记住上下文、省着用算力;M2RL 是多领域强化学习框架,想让一个模型在不同任务里都能自己学会干活;LiveClawBench 则是专门测物理 AI 的基准,看模型能不能在真实世界里抓取、操作物体。文章还提到三星已经采购了数万张 GPU 来搭 AI 基础设施...

推荐理由:这是一组三星研究院的技术打包发布,不是旗舰模型或产品上线,但胜在信息具体、方向明确。我会先打个折:正文没披露数万张 GPU 的具体型号和部署时间线,也没说 Meki 在端侧实测的延迟和功耗,所以不能当量产信号看。不过,三星把 Memory 架构、多领域 RL 和灵巧手评测一起端出来,等于公开了自己在 Physical AI 上的三条腿走路策略,对关注端侧和机器人方向的从业者来说,比单篇论文更有参考价值。

AI HOT 精选

Reachy Mini 机器人现在能完全在本地跑语音对话了

Hugging Face 给 Reachy Mini 机器人配了一套纯本地运行的语音对话方案,数据不用上传云端。他们用 speech-to-speech 库搭了一条流水线:先靠 Silero VAD 检测有没有人在说话,再用 Parakeet-TDT 把语音转成文字,接着交给大模型想怎么回,最后让 Qwen3-TTS 把文字念出来。这套东西通过一个兼容...

推荐理由:HKR 三项都成立:有个清晰的本地机器人语音钩子,技术栈细节给得实在,对边缘端语音代理场景有直接吸引力。范围就限定在 Reachy Mini 的语音交互上,所以放在 featured 档。

5月26日星期二

纽约时报中文网

中美共同的 AI 焦虑:怕被未来收割

作者在中美两头跑,发现两边的普通人都在被同一种不安笼罩:技术跑太快,红利不一定轮到自己。文章用滴滴司机钻算法空子、美国送餐员抢单的例子开场,指出 AI 在两国都加剧了职场监控、情感孤独和无力感。美国超七成青少年拿聊天机器人当陪伴,中国预计到 2030 年独居人口达 2 亿,AI 伴侣成了孤独的速效解药。科技精英忙着追逐风口和 AGI,普通人却用“社畜”...

推荐理由:这篇不是产品发布或模型论文,是一篇评论,但两个社会数据点和一个中美对照的框架让它有信息量。我会先打个折,因为正文没披露具体调查方法和样本量,数字的可靠性没法验证。不过它把技术趋势和人的孤独感直接挂钩,对从业者理解应用场景有启发,放在 featured 里当一篇有观点的解读是合适的。

5月25日星期一

机器之心 · 公众号

众趣科技开源浏览器端3D高斯泼溅查看器,10亿个高斯点也能跑,内存和速度都比李飞飞团队的Spark 2.0强

众趣科技把他们的Aholo Viewer开源了,这是一个在浏览器里直接看3D高斯泼溅场景的工具。在300万个高斯点的测试里,它占用的内存只有Spark 2.0的一半,加载速度快了一倍,渲染速度快了两倍,而且宣称能撑住10亿个高斯点的场景。不过正文因为环境验证没抓到具体技术细节,我会先打个折:实际效果得自己跑一下才知道,但光看这几个数字,在网页端做大规模...

推荐理由:这条消息我会打个80分。群核科技这次开源的不是基础模型,而是一个3D渲染工具,但“10亿高斯点塞进浏览器”这个钩子很直观,性能对比也给了具体数字,不是空口说快。对从业者来说,浏览器端能跑这种量级的场景,部署上确实省事省钱。不过正文没披露10亿点场景的具体交互帧率,这点先别太激动,等他们后续补数据。

5月22日星期五

AI HOT 精选

国家发改委:建训练基础设施,让机器人从跑马拉松到进工厂商场家庭

国家发改委在5月22日的发布会上,用北京亦庄人形机器人半马的成绩来说明具身智能的进步:参赛队伍从20多支涨到100多支,完赛队伍从6支涨到40多支,机器人跑得更快、过弯更灵活、导航更自主。下一步会重点建两样东西:一是训练基础设施,用来采集数据和训练机器人的“大脑”和“小脑”模型,让它在不同场景都能干活;二是应用中试基地,把软硬件生态和训练设施打通,加速...

推荐理由:这条政策指向很明确,就是要让机器人走出比赛场景,进到真实环境里干活。队伍和完赛数量的增长是实打实的进步,但正文没披露训练基础设施和中试基地的具体预算、时间表和规模,所以实际推进速度还得看后续落地细节。

机器之心 · 公众号

CVPR 2026 | HiF-VLA:用视频压缩的思路教机器人“边看动作边想下一步”

西湖大学团队搞了个叫 HiF-VLA 的框架,核心想法是把机器人看世界的方式从“一帧帧静态图”换成“画面怎么动的”。它直接用 H.264 这类视频编码器从画面里提取紧凑的运动向量,再让一个联合专家模型同时预测未来的视觉动态和该做的动作序列。论文里给的数据是,在设定的历史窗口下,显存峰值 31.4GB,延迟 117.7 毫秒。不过正文因为环境验证问题没加...

推荐理由:这篇 HiF-VLA 我会先打个折:它还是一个单篇研究,没有落地案例或多方交叉验证,所以放在 featured 低位。但它的思路确实比多数 VLA 论文更“省”——直接用 H.264 运动向量代替逐帧视觉编码,把“看变化”和“想动作”塞进联合专家里一起算,显存压到 31.4GB、延迟 117.7ms,对想在真机上跑实时推理的团队是个可参考的方向。正文没披露在真实机械臂上的成功率或与主流 VLA 的 head-to-head 对比,这点先别太激动。

彭博科技

Waymo 在亚特兰大暂停无人出租车,因为车辆会往洪水里开

Waymo 在亚特兰大的一辆车直接开进了被淹路段,导致公司暂停了五个城市的服务。问题出在车辆对积水路面的识别和决策上——它判断不出“水有多深、能不能过”,就硬着头皮往前开。这跟之前导致数千辆车被召回的是同一个毛病。不过正文没披露具体是哪五个城市,也没说什么时候恢复运营。

推荐理由:我会先打个折:正文没披露具体是哪五个城市、也没说什么时候恢复,所以影响范围还看不清。但 Waymo 作为头部的 robotaxi 玩家,因为积水这种真实路况直接触发数千辆车召回并暂停多城服务,说明物理世界的安全边界比实验室难控得多。这点先别太激动,但确实暴露了无人车在恶劣天气下大规模运营的脆弱性,对行业信心是个实在的磕碰。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

AI HOT 精选

FSD 官宣进入中国大陆,但没公布城市、车型和价格

特斯拉发了一条很短的官宣,说 FSD 正式进入中国大陆市场。正文没披露哪些城市能用、支持什么车型、怎么收费,也没提监管审批情况。目前只有一句话,我会先打个折,等具体落地细节出来再看。

推荐理由:我会先打个折:这条消息本身很短,就是一句“官宣进入大陆”,所以重要性更多来自 FSD 进中国这件事本身,而不是正文给了多少料。H 和 R 都成立——市场等这个落地等了很久,而且它确实会搅动自动驾驶圈的监管和竞争话题。K 不成立,因为正文没披露任何落地范围、定价或审批细节,没法当干货用。

5月20日星期三

新智元 · 公众号

摩尔线程 MUSA 生态更新:SDK 对齐 CUDA 12.8,SGLang 主线已合并

摩尔线程放出了自家 GPU 生态 MUSA 的最新进展。SDK 5.1.0 把兼容目标拉到了 CUDA 12.8,覆盖了 761 个驱动和运行时接口,意思是跑 CUDA 代码时能认的指令更多了。推理框架 SGLang 的主线代码已经合并了 MUSA 的支持,硬件支持排期在 2026 年第二季度。另外还提了一个叫 MUSACODE 的工具,能自动把库迁移...

推荐理由:我会先打个折:这还是一家厂商的生态更新,不是整个国产 GPU 阵营的集体突破。但文章把兼容 API 数量、SDK 版本对标和 SGLang 主线合入这几个点都摆出来了,比空谈“替代 CUDA”实在。老黄喝豆汁的梗让标题有了传播力,内文也没写成公关稿,对关注推理部署和算力自主的读者来说值得一看。

新智元 · 公众号

驭势科技在港交所上市,成为全场景L4自动驾驶第一股,市值超百亿港元

驭势科技今天在港交所挂牌,发行价每股60.30港元,公开发售部分超额认购6777倍。公司主要做机场、厂区这类封闭场景的L4级无人驾驶物流车和接驳车,2025年在大中华区机场L4商用车市场占了90.5%的份额。不过原文因为微信环境验证拦截,正文内容没抓到,具体的财务数据、技术路线和募资用途都没披露,这些关键信息得去翻招股书才能确认。

推荐理由:驭势科技港股上市,机场 L4 商用车市占率做到九成,公开发售被抢了六千多倍,说明市场对自动驾驶商业化这条路的买单意愿很强。不过正文没披露营收和盈利情况,光看市占率还判断不了生意本身赚不赚钱,这点先别太激动。

纽约时报中文网

中国法院第三次判企业用 AI 替代员工后辞退违法,杭州案月薪从 2.5 万降到 1.5 万被认定非法解雇

杭州中院把一起 AI 替代岗位的案子定为指导性案例:公司用 AI 取代质检岗,给员工调岗但月薪从 2.5 万砍到 1.5 万,员工拒绝后被辞退,法院认定公司没做合理安置,属于违法辞退。这是中国官方第三次公开支持被 AI 抢走工作的劳动者胜诉,信号很明确——企业引入 AI 算自愿降本,不能当裁员的理由。文章提到中国青年失业率约 17%,超 2 亿人在零工...

推荐理由:这篇 NYT 报道把中国 AI 政策与劳动仲裁案例绑在一起讲,杭州案的数字和判决理由都写清楚了。它不是模型发布或产品动态,所以重要性给 80、放在 featured 比当天必写更合适。我会先打个折:正文没披露企业名称和具体行业,但三个公开判例的累积信号已经够强,值得让从业者看到政策与法院之间的拉扯。

TechCrunch · AI

Google 把街景塞进 Genie 世界模型,现在能直接生成可交互的街道模拟

Google DeepMind 把 Street View 街景数据接入了自家的世界模型 Project Genie,让它能根据真实街道照片生成可交互的 3D 场景。你可以像玩游戏一样在模拟街道里走动,还能调天气、看极端气候下的样子。官方说这会用在机器人训练、游戏和旅游场景里,但正文没披露模型参数、上线时间,也没给任何评测结果,所以实际效果和成本都还是...

推荐理由:谷歌 DeepMind 把 Street View 塞进 Project Genie,等于让街景从静态照片变成能走进去互动的模拟环境。我会先打个折:正文完全没披露模型大小、推理延迟、上线计划,也没给任何定量评测,所以现在只能当一次技术演示看。但它的钩子很实在——机器人训练可以直接用真实街景做仿真,游戏生成也能拿到现成的地图素材,再加上谷歌手里独一份的街景数据,这个方向本身值得关注。

5月19日星期二

AI HOT 精选

现代汽车计划在自家工厂部署 2.5 万台波士顿动力 Atlas 人形机器人

现代汽车集团在摩根大通的投资者会上说,要在现代和起亚的制造工厂里用上超过 2.5 万台 Atlas 人形机器人,目标到 2028 年实现年产 3 万台。执行器(相当于机器人的关节和肌肉)会在美国工厂生产,规划年产能超过 30 万个。不过正文没披露具体什么时候开始铺、铺到哪些工厂,也没说采购成本。

推荐理由:这条消息就一句话:现代汽车要搞 2.5 万台 Atlas。数字够大,所以能上推荐位。但我会先打个折,因为正文没披露部署时间、场景和采购条件,等于只给了一个量级,没有落地信息。如果是真的,这个采购规模挺省钱也够吓人,但这点先别太激动,等具体方案出来再看。

AI HOT 精选

地平线开源了 4 亿参数的机器人控制模型 HoloMotion-1,能跳舞、搬箱子,端侧跑到 300 帧

地平线机器人实验室把一个人形机器人全身控制模型 HoloMotion-1 开源了,参数规模 4 亿,他们管它叫“机器人小脑”。这个模型用了 MoE 稀疏激活和 KV-cache 推理,把单步推理开销压下来,在端侧能跑到约 300FPS,比常见的 50Hz 控制频率高出一大截。训练数据来源比较杂,包括互联网视频、光学动捕、VR 遥操作和惯性动捕,经过统一...

推荐理由:HoloMotion-1 是一个开源机器人控制模型,4 亿参数能在端侧跑到约 300FPS,对做具身智能的团队来说是个可复现的参考。不过目前只看到动作生成能力,正文没披露在真实机器人上的成功率或延迟数据,实际部署效果还得等后续验证。整体偏技术发布,影响力集中在机器人圈子,放在 featured 档位合适。

量子位 · 公众号

摩尔线程发布国产全栈具身智能仿真平台,机器狗“小飞”全程在自家 GPU 上完成训练

摩尔线程推出了 MT Lambda 仿真平台,把物理引擎、渲染和 AI 模型训练整合到一起,用自家的 GPU 跑通了从模拟到真机的完整流程。现场演示的机器狗“小飞”在仿真里学会走路后,直接迁移到实物上就能跑。不过正文因为需要验证码没能完整抓取,具体的技术参数、训练时长和成功率数据都没披露,这点先别太激动。

推荐理由:我会先打个折:性能、定价、开放方式和第三方验证正文都没给,所以重要性只能停在 featured 低位。但这条消息本身信息量够——摩尔线程拿出的是一个国产 GPU 驱动的具身仿真方案,不是纯软件缝合,而且用机器狗“小飞”做了 100% 仿真训练到真机迁移的 demo,说明链路至少跑通了。对国内做机器人、做仿真的人来说,这相当于多了一个可能绕开 NVIDIA 生态的选项,哪怕现在还很早期,也值得标记一下。

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

AI HOT 精选

百度核心 AI 业务 Q1 营收超 136 亿元,首次占通用业务收入过半

百度发了 2026 年 Q1 数据,核心 AI 驱动业务收入超过 136 亿元人民币,同比增长 49%,连续多个季度在涨。这个数字第一次超过百度通用业务收入的一半,说明 AI 相关收入已经从“添头”变成了主力。增长主要来自 AI 云基础设施、AI 应用和自动驾驶出行平台 Apollo Go。完整财报链接在原文里,正文没拆开各板块的具体数字,所以没法判断...

推荐理由:这条是百度自己发的财报口径,只给了总收入数字和占比,没拆各块业务(比如智能云、Apollo Go)各自贡献多少,也没提利润率。所以“AI 收入过半”这个结论先打个折——它更像一个对外叙事信号,而不是一份能细拆的账本。对从业者来说,知道百度 AI 商业化在加速就够了,但别拿这个数字直接对标其他厂的收入结构。

Latent Space

无人机自主技术栈与经济学:从宠物摄像头到 AI 制导炸弹

Yaroslav Azhnyuk 是 The Fourth Law 的创始人,这家公司做 AI 制导无人机。他之前创办了 Petcube,卖的是给宠物扔零食的摄像头,现在做的是给占领军扔炸药的摄像头。这期播客他和 Noah Smith 聊了两个小时,核心是 FPV 穿越机怎么成了战场上的新杀器——前线 70% 到 80% 的伤亡都是它造成的。他提出无人...

推荐理由:这是一期播客对谈,不是产品发布或论文,所以别当硬核技术报告看。我会先打个折:它给的是行业判断和框架,不是实测数据。但聊得挺实在,把无人机从遥控到全自主拆成了5个等级,又用8个维度讲战场怎么用、成本怎么算,还专门分析了中国制造为什么能把价格打下来。对想快速理解无人机产业和自主化路线的人,这期信息密度够,值得放进精选。

5月17日星期日

量子位 · 公众号

一只机器狗,把英伟达的算力王座拱翻了

蔚蓝科技发了款消费级机器狗 BabyAlpha A3,用六颗芯片搭了个异构计算集群,直接在本地跑 7B 参数的大模型,推理速度到 280 TPS。视觉上配了 6600 万像素的摄像头,每秒能扫出 223.2 万个点云数据点,计划第三季度上市。不过正文因为环境验证没抓到具体内容,上面这些数字都来自外部摘要,实际表现和定价还没法核实。

推荐理由:我会先打个折:正文是单篇产品发布稿,没披露功耗、价格和对比基准,所以别太激动。但这条消息确实有料——蔚蓝科技在机器狗里塞了6颗芯片搭异构集群,本地跑70亿参数模型,推理速度标到280TPS,Q3就要上市。对做端侧部署和机器人的人来说,这等于给“离了英伟达行不行”提供了一个实物样本。信息缺口也很明显:没写具体芯片型号、没给功耗数据、没说明280TPS是在什么精度和batch size下测的,这些都会影响实际可用性。综合来看,角度抓人、事实具体、但验证信息不足,放在featured门槛上刚好。

机器之心 · 公众号

世界模型的两条路线和一场百亿赌局

这篇文章是机器之心编译自 MoE Capital 的一篇博客,梳理了“世界模型”这个概念的两条发展脉络。一条是 AI 学术圈常说的,让模型在脑子里推演环境变化、做规划;另一条来自游戏和影视工业,追求用模型直接生成逼真的 3D 世界。文章提到,过去一年半里,有超过 100 亿美元的资金涌入了这个方向。里面举了一个具体例子:DreamDojo 这个项目用 ...

推荐理由:这篇是编译的科普+评论,不是一手发布,但把世界模型两条路线讲得清楚,还给了百亿美元和44711小时视频这些具体数字。我会先打个折,因为信息密度集中在解释概念,新事实不多。不过对想快速理解世界模型热度和技术现状的人来说,读这一篇比翻论文省时间。

5月16日星期六

Hacker News 首页

特斯拉披露两起 Robotaxi 事故,远程安全员介入时撞了

特斯拉公开了两起 Robotaxi 碰撞事故,都发生在远程安全员接管车辆的时候。目前 TechCrunch 的报道正文没披露具体地点、时间、伤亡情况和车辆当时的决策状态,也没说清楚远程接管是在什么触发条件下启动的。Hacker News 上只有 27 个点赞和 17 条评论,讨论热度一般。我会先打个折:光凭标题和摘要看不出是系统先出错再交给人,还是人接...

推荐理由:特斯拉主动说了两起 Robotaxi 事故,都跟远程操作员有关,这点本身就挺少见。我会先打个折:原文只有 27 分、17 条评论,信息量很薄,没写事故发生在哪、有没有人受伤、远程接管是人为失误还是系统兜底。所以它更像一个安全信号,还不是能拿来下结论的实锤。对从业者来说,值得看一眼,但别急着激动。

机器之心 · 公众号

机器人为什么需要世界模型?顶尖机构联合发布综述

这篇综述正文被微信的验证页面挡住了,我没法看到具体内容。从标题和已知信息看,NTU MARS Lab 联合几家机构发了一篇 43 页的综述,讲的是机器人世界模型。世界模型可以理解成让机器人脑子里有个对物理世界的模拟器,能预判“我动一下会发生什么”,而不是每次都靠真实试错。文章大概会梳理这类模型怎么定义、用什么架构、在哪些任务上能用,以及当前卡在哪——比...

推荐理由:我会先打个折:标题里的“震撼发布”可以忽略,但内容本身不水。这篇综述把机器人世界模型这件事拆得很细——从“世界模型到底是什么”到怎么搭、怎么测、动作一致性卡在哪,都给了结构化的梳理。对正在琢磨具身智能或仿真训练的人来说,相当于一份现成的地图,省得自己去翻几十篇论文。不过它没给出具体的性能数字或成本对比,所以别指望直接拿来算投入产出。

AI HOT 精选

黄仁勋对 CMU 计算机毕业生说:电工水管工比你们更有前景

黄仁勋在卡内基梅隆大学 2026 届计算机科学毕业典礼上直接说,技工的前景比计算机毕业生好。Randstad 的数据显示技工需求增速是白领的三倍,机器人技术员岗位涨了 107%,而斯坦福研究发现 AI 相关职位的早期就业反而降了 16%。顶级电工年薪能超过 10.6 万美元,还不用背学费贷款。另一边,科技公司今年砸了 7000 亿美元建数据中心,全球到...

推荐理由:黄仁勋在毕业典礼上劝 CS 学生考虑技工,这话本身就够抓眼球。Randstad 给了两个数字:技工需求增速是白领 3 倍,机器人技术员岗位涨 107%,说明动手修机器、调设备的人越来越抢手。对做 AI 的人来说,这等于在问:写代码和管机器人,哪个饭碗更稳。不过这只是 X 上的评论,不是产品发布或政策变动,所以放在低 featured 就够了。

Hacker News 首页

Waymo 召回 3800 辆无人出租车,因为软件 bug 会让车开进积水里

Waymo 主动召回了约 3800 辆自动驾驶出租车。原因是软件里有个漏洞,导致部分车辆在识别路况时,会直接开进路面积水区域。报道里没有说清楚到底发生了多少起涉水事故、具体是哪个软件版本出的问题,也没提修复方案是远程更新还是需要回厂处理。

推荐理由:标题说车开进洪水,正文只给了召回数量和触发条件,事故次数、软件版本、怎么修都没提。我会先打个折,这更像一条有信息增量的安全事件,不是重大技术发布。

AI HOT 精选

杨立昆播客访谈:LLM 走不远,他离开 Meta 去赌世界模型

杨立昆在 Unsupervised Learning 播客里把大语言模型的底牌翻了个遍。他直接说 LLM 这条路有天花板,劝博士生别再往里扎。他预测到 2027 年,纯靠堆语言数据做不出真正的智能。他离开 Meta 后创立的 AMI 公司,核心押注在“世界模型”上——让 AI 像人一样通过观察和互动去理解物理世界,而不是只读文本。访谈里他还跟老搭档 H...

推荐理由:我会先打个折:这是播客访谈,不是论文或产品发布,信息密度高但验证性弱。杨立昆的核心判断是当前大语言模型路线走不到人类级 AI,他把宝押在世界模型和 AMI 上,还给了 2027 这个时间点——这点先别太激动,正文没披露他具体依据什么数据或实验得出这个年份。他离开 Meta 的原因和与 Hinton、Bengio 的分歧是这次的新料,尤其是安全观上的对立,直接关系到行业资源往哪投。整体看,这篇访谈把一位关键人物的技术判断、职业选择和路线分歧打包在一起,对从业者判断风向有帮助,但很多结论还缺公开验证。

5月15日星期五

r/LocalLLaMA

用 Jetson Orin NX SUPER 16GB 做了个完全离线的行李箱机器人,跑 Gemma 4 E4B,没联网也能聊

一个叫 Sparky 的行李箱机器人,核心是一块 Jetson Orin NX SUPER 16GB 的板子,跑的是 Gemma 4 E4B 模型(Q4_K_M 量化版,用 q8_0 做 KV 缓存)。首次响应延迟大概 200 毫秒,生成速度每秒 14 到 15 个 token,上下文窗口 12K。身上挂了 30 多个传感器,但没装 WiFi、蓝牙和蜂...

推荐理由:这是个 Reddit 上的个人项目帖,不是产品发布或论文,所以放在低 featured 档。我会先打个折:200ms 的缓存首 token 延迟和 14-15 tok/s 的生成速度,在 Jetson 上跑 4B 模型算是能用的水平,但别指望它反应飞快。30+ 传感器听起来唬人,正文没细说都是什么传感器、怎么融合的,这点先别太激动。真正有意思的是全离线跑 Gemma 4 E4B 还让机器人带“观点”,把本地推理做成了人格化交互,比单纯报参数好玩。

5月14日星期四

机器之心 · 公众号

灵初智能用10万小时人类操作数据训练机器人,但文章正文被验证页挡住了

这篇微信文章标题说灵初智能(PsiBot)用了10万小时的人类操作数据来训练机器人策略,还提到一个叫W0的世界模型只在训练时做迁移,实际部署只跑R2。但页面被环境异常验证拦住了,正文内容完全看不到,没法确认具体怎么采集数据、在什么任务上验证、效果到底怎么样。

推荐理由:这篇讲的是灵初智能用10万小时人类操作数据训机器人策略,W0世界模型负责训练时的迁移,部署时只跑R2,省算力。我会先打个折:10万小时这个数字挺唬人,但正文没披露数据怎么采集、覆盖哪些任务、成功率多少,也没给论文或开源链接,所以只能当公司说法看。对从业者来说,W0训练期迁移、R2部署这个架构思路有参考价值,但缺验证就不好判断实际效果。整体像产品发布稿,不是可复现的研究,所以放在featured但分数没往上拉。

彭博科技

发那科搭上谷歌,股价直接冲上历史新高

工业机器人巨头发那科宣布跟谷歌合作搞“物理 AI”,消息一出股价飙到历史最高点。正文被 Bloomberg 的付费墙挡了,没披露合作具体做什么、股价涨了多少、什么时候落地。从标题看,市场是把这当成真金白银的利好来炒的——毕竟谷歌在 AI 上的技术积累,配上发那科在工厂里的硬件铺货量,想象空间确实大。但正文没给细节,这点先别太激动,等具体方案出来再看是真...

推荐理由:Bloomberg 的消息源靠谱,Fanuc 股价创纪录这个事实本身就够硬,所以 H 和 R 都给了。但我会先打个折:正文没披露合作机制、股价涨幅、产品细节或时间表,K 完全撑不起来。这点先别太激动,等后续有实质内容再说。

彭博科技

Anduril 估值翻倍至 610 亿美元,刚拿了 50 亿新融资

Anduril 在 Thrive Capital 和 a16z 领投的一轮里融了 50 亿美元,估值直接跳到 610 亿美元,比上一轮翻了一倍。CEO Brian Schimpf 说这笔钱主要砸在三个地方:扩大产线、研发和基础设施。视频里没给具体的收入数字或交付时间表,所以这个估值到底靠多少实际订单撑着,正文没披露。

推荐理由:Anduril 这轮 50 亿直接把估值拉到 610 亿,翻了一倍,说明资本在押注国防 AI 和自主系统的制造规模。钱会砸进工厂、研发和基建,不是纯烧模型,而是铺产能。我会先打个折:正文没披露具体产能目标或交付时间表,所以别急着算回报。对从业者来说,这更像一个信号——国防机器人赛道在加速从原型走向量产,但验证还要看后续订单和交付数据。

5月13日星期三

机器之心 · 公众号

林俊旸被曝离职创业,新 AI 实验室估值冲到 20 亿美元

The Information 爆料,阿里通义千问前技术负责人林俊旸正在为一家新 AI 实验室融资,目标融几亿美元,投后估值可能到 20 亿美元。目前实验室具体研究方向、团队规模和最终估值都还没公开。

推荐理由:这条消息我会先打个折:目前只有 The Information 的融资传闻和估值数字,研究方向、团队构成、产品计划一概没提。亮点是林俊旸本人从阿里出来单干,新 Lab 估值直接喊到 20 亿美元,说明资本还在抢头部 AI 人才。但正文没披露最终估值是否敲定、钱从哪来、做什么方向,这些关键信息都缺着,所以先当一条人才+融资信号看,别太激动。

5月12日星期二

机器之心 · 公众号

宇树出了个能坐人的变形机甲,390 万起卖

宇树科技发了款叫 GD01 的载人机甲,能两条腿或四条腿走路,起步价 390 万人民币。官方说载重差不多 500 公斤,但正文没披露续航、操控方式、量产时间这些关键信息。这个价格放在民用机甲里不算离谱,不过目前只有发布消息,实际交付和性能验证都还没影,先当个概念车看比较合适。

推荐理由:宇树这次发布的 GD01 是个载人变形机甲,能双足走也能四足跑,载重约 500 公斤,起步价 390 万元。我会先打个折:这更像一个炫技的概念产品,离实用还很远,正文也没披露续航、操控方式、安全冗余这些关键信息。但“民用高达”的标签和明确标价本身就自带话题,说明宇树在试探高端消费市场和品牌上限。对从业者来说,看点不是这台机甲能不能打,而是国内机器人公司开始用这种夸张品类抢注意力了。