跳到正文

#多模态

今日 1 条

6月3日星期三

机器之心 · 公众号

蚂蚁灵波在 RSS 2026 提出首个自回归因果世界模型,用 50 条演示数据就能让机器人学会通用操控

蚂蚁灵波和港科大搞了个叫 LingBot-VA 的模型,把“预测画面接下来怎么变”和“判断该做什么动作”合到一个自回归框架里。论文说,每个任务只用 50 条真实世界的演示数据微调,在 RoboTwin 2.0 的简单和困难设定下,成功率分别到了 92.0% 和 91.1%。不过原文因为微信环境异常没抓到,具体实验细节和泛化边界暂时看不到,这个成功率数字...

推荐理由:标题的“50条数据”是个强钩子,对数据成本敏感的从业者吸引力很大。文章把自回归因果世界模型的机制讲得比较清楚,就是让模型先预测画面变化再决定动作,不是黑箱。但全文只有一篇论文发布,没看到开源代码、实物测试视频或跟主流基线(比如扩散策略)的量化对比,验证强度不够。所以重要性给78,属于值得关注但别急着全信的研究发布。

Latent Space

微软一口气发了7个新模型,MAI-Thinking-1是主打,还附了109页技术报告

微软在Build大会上发布了7个MAI系列模型,覆盖文本推理、代码、图像、语音转文字和语音合成。主角是MAI-Thinking-1,一个35B活跃参数的混合专家模型,支持256K上下文窗口。它被定位为微软首个推理模型,训练数据链条干净,没有用任何第三方模型做蒸馏。随模型一起公开的109页技术报告在圈内评价很高,因为透明度给得足。报告里写明,模型的推理能...

推荐理由:我会先打个折:微软这次没公开模型权重、定价,也没给第三方评测结果,所以没法验证它实际有多强。但光凭 7 个模型、35B 激活参数的 MoE、256K 上下文和 109 页技术报告这几个硬数字,信息密度已经够高。加上这事发生在 Build 大会,直接摆在微软自家模型和 OpenAI 依赖的交叉点上,话题性拉满。正文没披露具体 benchmark 分数,这点先别太激动,但作为当天新闻,重要性给到 87 是合理的。

量子位 · 公众号

大晓机器人和南洋理工搞了个统一物理3D生成框架,刚体、软体、带关节的物体都能一次搞定

这个框架叫PhysX-Omni,目标是让生成的3D模型直接能进物理仿真跑起来,不用再手动修。它把刚体、软体和关节体三类物体的生成统一到一个流程里,省掉了以前要分开处理的麻烦。配套的PhysXVerse数据集有8700个资产,覆盖2900个类别,规模不小。评测基准PhysX-Bench从几何、尺寸、材质、可交互性、运动学和文字描述六个维度打分,但正文没披...

推荐理由:统一物理 3D 生成这个钩子很清晰,数据集和评测基准的规模也给了实锤,对做机器人仿真的团队确实有用。不过正文没提开源、没提落地案例,也没说生成质量跟现有方案比到底好多少,所以分数先不打满,78 分合理。

AI HOT 精选

xAI 发布 Grok Imagine 1.5 预览版,一张静态图就能生成 720p 视频

xAI 在 API 里放出了 grok-imagine-video-1.5-preview 模型,能把单张静态图片变成一段动态视频。你给它一张起始帧,再用自然语言描述想要的镜头运动、节奏和音效,它就会按你的指令生成一段最高 720p 的短片。官方说模型会尽量保留原图的光影和细节,让视频像是原图的延续,而不是重新画了一遍。它也支持把多段生成视频串起来,拼...

推荐理由:xAI 放出了一个能用的图像转视频 API 预览版,720p 输出加上用自然语言调镜头和音效,功能点很实在。我会先打个折,因为这只是个预览版,不是完整的基础模型发布,所以重要性停在 82 分。

AI HOT 精选

Runway 把 Aleph 2.0 视频编辑放上 API,最长能改 30 秒 1080p 多镜头片段

Runway 的 Aleph 2.0 视频编辑功能现在可以通过 API 调用了,你可以把它直接嵌进自己的应用或产品里。它支持对最长 30 秒、1080p 的多镜头视频做局部修改,只动你想改的那部分,其他画面不变。正文没提价格、调用频率限制、处理延迟和地区可用性,这些实际落地要用的信息都还没给。

推荐理由:Runway 是视频生成的核心玩家,Aleph 2.0 把局部视频编辑能力开放成 API,上限拉到 30 秒和 1080p。这是个实用的产品更新,不是模型级大版本发布,重要性中等偏上。

r/LocalLLaMA

用 LiteRT 跑 Gemma 4 E4B,文字生成比 Q4 GGUF 快 2.4 倍,图片处理几乎没变

有人在 RTX 4060 Ti 16GB 上实测了 Gemma 4 E4B 模型。用 LiteRT 引擎跑文字生成,平均每秒能出 157.2 个 token,而用 llama.cpp 的 Q4 GGUF 格式只有 66.3 tok/s,快了大约 2.4 倍。不过图片标注任务就没这么乐观了:处理 111 张全分辨率图片,LiteRT 耗时约 72 秒,Q...

推荐理由:这是一篇个人在 Reddit 上发的实测,不是官方报告,权威性有限,所以分数没往上拉。但 H、K、R 三项都站得住:速度对比抓眼球,测试条件和数据都写清楚了,对想在自己机器上跑 Gemma 的人有直接参考价值。我会先打个折,因为只有单卡单次测试,没提功耗和精度变化,但作为一手体验已经够用。

The Verge · AI

微软在 Build 2026 上发了 Project Solara,一个给 AI 硬件跑智能体的安卓系统

微软在 Build 2026 大会上公布了 Project Solara,一个专门为跑 AI 智能体的硬件设计的操作系统。它底层是安卓,不是 Windows。现场展示了两个概念机:一个是类似 Echo Show 的桌面设备,用人脸识别解锁后可以直接调用各种 AI 智能体;另一个是可穿戴工牌,带摄像头和指纹扫描,能唤醒 AI 智能体。正文没披露具体上市时...

推荐理由:我会先打个折:正文没给发货时间、开发者接口和定价,所以别当产品发布看。亮点是微软在 Build 2026 上拿出的 Project Solara,一个跑在 Android 上的 AI 硬件系统,不是 Windows。现场有两台概念机,一台放桌上的带人脸识别,一台可佩戴的徽章带摄像头和指纹,说明微软在试探 agent 硬件长什么样。系统层面用 Android 意味着生态借力,但也绕开了自家系统,这点挺有意思。隐私那块正文没展开,只提了人脸和指纹,具体怎么处理数据没说。

6月2日星期二

AI HOT 精选

阶跃星辰放出 Step 3.7 Flash,开放权重,主打帮智能体写代码

阶跃星辰发了个新模型 Step 3.7 Flash,把权重开放了,你可以直接下载用。它的定位是给智能体编程场景用,强调工具调用可靠,还能处理多模态输入。同一天 MiniMax 也开源了 M3,两家模型都已经能在 Kilo 平台上跑。正文没披露具体的跑分、参数量或硬件门槛,所以实际快不快、省不省资源还得自己测。

推荐理由:这条消息的钩子在于“开放权重”和“智能体编程”两个点,不是常规发个新版本。我会先打个折:正文没给模型尺寸、跑分、许可证和定价,所以只能算有信息增量但缺关键验证。对开发者来说,能直接下载权重、能调工具、能看懂多模态输入,这几个能力放在一起确实有吸引力,尤其现在大家都在抢智能体编程这条赛道。Kilo 上线也让想试的人有个现成入口。不过没披露性能对比和实际成本,这点先别太激动,等后续数据出来再看值不值得切过去。

r/LocalLLaMA

NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型,能同时吃文字、图片、视频并生成视频、音频和动作指令

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face,这次发了两个尺寸:Nano 版 160 亿参数,Super 版 640 亿参数。它是个全模态世界模型,输入可以混着来——文字、图片、视频甚至动作轨迹都行,输出也不止视频,还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了,实际跑起来的硬件门槛...

推荐理由:我会先打个折:正文没披露 benchmark 分数、许可证和训练细节,所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上,这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说,输入支持动作轨迹、输出能直接给动作指令,说明它不只是生成漂亮画面,而是想往物理交互方向靠。这点先别太激动,因为没看到在真实机器人任务上的验证,但方向对,且开源降低了试错成本。

量子位 · 公众号

老黄带着英伟达 CPU 杀进 PC 赛道

英伟达要在今年秋天把一台叫 RTX Spark 的 Windows 电脑推向市场。这台机器把一块 Blackwell 架构的 RTX 显卡和一颗 20 核 Arm 架构的 Grace CPU 焊在一起,通过 NVLink-C2C 高速互联,共享 128GB 统一内存。官方给出的 AI 算力是 1 petaflop,号称能在本地跑起 1200 亿参数、上...

推荐理由:英伟达把RTX Spark搬进Windows PC,不是发新模型,而是给开发者一台能本地跑120B模型的机器。1 petaflop算力和128GB统一内存这些数字,说明它想解决本地跑大模型内存不够、上下文装不下的痛点。对从业者来说,这意味着可以省掉一部分云端推理成本,延迟也更可控。不过正文没提具体功耗和价格,实际性价比还得等上市再看。整体是硬件产品更新,不是基础模型发布,所以分数落在78到84之间。

Latent Space

英伟达连发三弹:Cosmos 3 世界模型、Nemotron 3 Ultra 大模型,还有一台叫 Spark 的个人超算

英伟达在台北电脑展上放出了一波开源模型和硬件。Cosmos 3 是一个能同时处理文字、图片、视频、音频和动作的“世界模型”,用了混合 Transformer 架构,把负责推理和负责生成的两个模块拼在一起。它分 Nano(16B)和 Super(64B)两个尺寸,其中 Super 微调后的文生图和图生视频能力,在开放权重模型里直接冲到了第一。Nemotr...

推荐理由:这次发布把视觉世界模型、大语言模型和本地推理硬件捆在一起推,信息密度高。Cosmos 3 的 MoT 架构和两个具体尺寸(16B/64B)给了明确的技术锚点,Nemotron 3 Ultra 的 550B-A55B 开放权重对想自己部署大模型的人是个实在消息。不过正文没给出具体 benchmark 对比或价格,实际效果和性价比还得等上手。整体影响面广,但还没到前沿实验室发新基础模型那种震动级别。

AI HOT 精选

NVIDIA Cosmos 3 在开放权重模型里拿了图像和视频生成双料第一

NVIDIA 的 Cosmos 3 在 Artificial Analysis 的开放权重榜单上,文本生图和图片转视频两项都排到了第一。它用了一种叫 Mixture-of-Transformers 的架构,把自回归推理器和扩散生成器拼在一起,有 16B 参数的 Nano 版和 64B 参数的 Super 版。Super 版在两项任务上分别超过了 HiD...

推荐理由:Cosmos 3 在 Artificial Analysis 的开放权重榜上把图像和视频生成的头名都拿了,我会先打个折——这只是单一基准的排名,不代表实际场景一定最强。但亮点在于它直接给了 16B 和 64B 两个尺寸,而且权重、代码、数据、微调方案全开源,这点对想自己训模型的人挺实在。正文没披露训练成本和推理延迟,所以别急着下“省钱”的结论。整体看,这条消息对关注开源多模态竞争的从业者有参考价值,放在 featured 档合适。

AI HOT 精选

Gemini Omni 能生成你的数字分身,放进视频里

Gemini App 发帖演示了用 Gemini Omni 捏一个长相和声音都像你的数字分身,然后直接塞进视频创作里。帖子没提这个功能什么时候上线、要不要付费,也没说怎么防止别人拿你的形象乱用。

推荐理由:我会先打个折:正文只说了 Gemini Omni 能做个人数字分身,没披露上线范围、价格、安全机制或授权流程,所以信息缺口不小。但官方账号自己放出这个功能点,说明产品方向已经定了,对做视频创作和虚拟人业务的人是个明确信号。HKR 三项都踩中:钩子够强,事实够新,风险够直接。因为细节太少,重要性只能给到 74,放在 featured 里当个产品更新提醒,别当成熟方案看。

6月1日星期一

AI HOT 精选

MiniMax 开源 M3 模型,把写代码、读长文和看图听声塞进一个系统,跑分压过 GPT-5.5 但成本只要十二分之一

MiniMax 放出了一个叫 M3 的开源模型,把代码能力、一次能读 100 万 token 的长上下文和原生多模态(能直接处理图像、音频)做在了一起。在 SWE-Bench Pro 这个代码基准上拿了 59.0%,比 GPT-5.5 的 58.6% 和 Gemini 3.1 Pro 的 54.2% 都高一点;在 BrowseComp 自主浏览任务上 ...

推荐理由:我会先打个折:目前只有一条 X 帖子,没看到官方技术报告或第三方独立评测,所以分数压在 78–84 区间。但 M3 确实把编码、超长上下文和多模态打包开源,SWE-Bench Pro 59.0% 不算顶尖但够用,成本只有 GPT-5.5 的约 1/12,对想省钱又有长上下文需求的团队是个实在选项。这点先别太激动,等正式文档和更多实测出来再调判断。

Latent Space

视频智能体是下一个方向:Ethan He 谈 xAI Grok Imagine 的三个月从零到一

Ethan He 在 NVIDIA 做完 Cosmos 世界模型后跳到了 xAI,带着一个小团队三个月就做出了 Grok Imagine。他有个很直接的观点:视频模型现在的智能主要来自语言模型,不是靠堆视频数据训练出来的。下一个 Sora 级别的突破不会是更好的视频生成模型,而是能规划、生成、修改、反复打磨一个完整创意任务的视频智能体。这期播客聊了从零...

推荐理由:我会先打个折:这篇是访谈级别的信号,不是论文或产品发布。它给了“三个月小团队从零搭建”这个事实,也点出了视频 Agent、音视频对齐和推理加速这几个方向,但正文没披露任何基准分数、具体成本数字或可复现的测试方法。所以它更像一份来自 xAI 内部的路线图预告,能帮你判断他们在往哪使劲,但暂时没法拿来做技术选型。对关注视频模型和多模态 Agent 的人来说值得扫一眼,别当结论用。

AI HOT 精选

NVIDIA 开源 Cosmos 3:一个模型搞定物理世界的看、想、动

NVIDIA 在 GTC Taipei 把 Cosmos 3 完全开源了,模型权重、代码和数据集都放了出来。它被叫做首个物理 AI 全能模型,意思是能直接看懂真实世界、预测接下来会发生什么,并给出机器人该做的动作。这次发了两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提具体跑分和硬件门槛,实际部署成本还得自己测。

推荐理由:HKR 三项都成立:钩子是 NVIDIA 开源物理 AI 模型,知识增量是 32B/8B 双版本加全套开放物料,受众是机器人、仿真方向的从业者。正文信息很薄,没给基准测试、没提许可证细节,所以分数压在 78–84 区间,不往上拔。

新智元 · 公众号

阶跃星辰发布 Step 3.7 Flash,196B 参数的 MoE 模型每次推理只激活 11B,速度冲到 400 tokens/秒,跑 Agent 任务...

阶跃星辰这次放出的 Step 3.7 Flash 是个混合专家模型,总参数量 196B,还挂了一个 1.8B 的视觉编码器,但每次推理实际只动用 11B 参数,所以能跑到每秒 400 个 token。官方说在 Agent 任务上,它的成本只有 Claude 的零头。不过正文因为微信环境验证没抓到具体内容,实际跑分、具体任务对比和定价细节都没披露,这点先...

推荐理由:速度和参数数字都摆出来了,标题里那个成本对比很抓人。但正文没披露具体定价、基准测试的细节和开源条款,所以分数只能停在 82 这个质量更新档位。

机器之心 · 公众号

OpenAI 为机器人团队招兵买马,由 Sora 负责人带队,部分岗位底薪开到 34 万美元以上

OpenAI 放出了十多个旧金山的机器人岗位,团队由 Sora 的负责人 Aditya Ramesh 带队,是从他之前的 Worldsim 项目演变过来的。其中执行器设计工程师的底薪现金在 34.2 万到 44.5 万美元之间,另外还有 PPU 激励。不过原文因为微信环境异常,具体岗位职责和团队规模都没披露,只能看到招聘信息的大致框架。

推荐理由:这条消息有明确的团队、负责人和薪资数字,不是模型或产品发布,但作为招聘信号已经够硬。我会先打个折:目前只是招人阶段,离实际产品还有距离,这点先别太激动。不过 OpenAI 把机器人当成全栈方向来做,薪酬又直接对标顶级硬件人才,对同行抢人和行业风向都有参考价值,所以放在 featured 档位没问题。

机器之心 · 公众号

VAST 发布 Project Eden,世界模型第一次能像游戏一样“存档”了

VAST 推出了一个叫 Project Eden 的三层世界模型架构,把场景的持久状态和画面渲染拆开了。简单说,就是给 AI 生成的 3D 世界加了个“存档”功能,你改过的东西下次打开还在,不用每次都重新生成。文章还提到 VAST 在 A+ 和 A++ 轮一共融了将近 2 亿美元。不过正文因为微信页面环境异常被屏蔽了,具体技术细节和效果演示都没看到,这...

推荐理由:我会先打个折:VAST 不是一线基础模型实验室,正文也没披露具体基准测试结果或开放接入方式,所以分数落在 78–84 区间。但 Project Eden 把世界状态推演和视觉渲染拆成三层,还给了“存档”这个产品钩子,加上近 2 亿美元的融资规模,对关注仿真基础设施的从业者来说信息量够硬。

量子位 · 公众号

招商局狮子山实验室开源 LiOS 架构,把云端大模型延迟压到 30 毫秒,还送了个叠衣服数据集

招商局狮子山人工智能实验室放出了一个叫 LiOS 的边云架构,专门解决机器人怎么用上云端大模型的问题。他们跨机器测下来,从本地摄像头到云端 GPU 显存,单向延迟大约 30 毫秒,这个数字对很多实时控制场景已经够用了。架构里低延迟视频传输模块直接开源,还附带了一个 LeFold 叠衣服数据集。不过正文因为微信环境异常没加载出来,具体用了什么模型、在哪些...

推荐理由:我会先打个折:招商局狮子山实验室不是头部平台,也没看到多源交叉验证,所以影响力止步中等。但这条消息确实给了干货——30ms相机到云端显存的延迟数字,说明端云协同在物理世界干活有戏,不是纯画饼。开源图传模块和叠衣数据集也算实在,同行能直接拿来测。正文没披露具体模型规模、功耗和复杂场景下的抖动,这点先别太激动。

量子位 · 公众号

VAST 拿了近 2 亿美元,首次公开世界模型 Eden 的技术路线

VAST 在 A+ 和 A++ 轮融了近 2 亿美元,同时公布了 Project Eden 世界模型的架构。这套架构把“世界状态怎么变”和“画面怎么渲染”拆开了:先有一个结构化的状态层来推演变化,中间加一层条件接口做翻译,最后再用生成式渲染层出图。正文没披露具体估值、投资方和模型落地时间表,技术细节也只给了三层框架,没有实验数据和验证指标。

推荐理由:VAST拿了近2亿美元A+和A++轮,同时把Project Eden的三层架构亮出来:状态层管世界推演,条件接口层接外部输入,生成式渲染层负责最终画面。这个拆法让世界模型不再是一团黑盒,对做3D和具身智能的人有启发。不过正文没给出任何量化指标、开源时间或实际跑通的场景,所以我会先打个折,不往顶格推。

AI HOT 精选

Runway 与 NVIDIA 联手搞了个 Cosmos Coalition,要一起做开放的世界模型

Runway 宣布以创始成员身份加入 Cosmos Coalition,跟 NVIDIA 和一批头部 AI 实验室搭伙,目标是共建并开源面向物理 AI 的前沿世界模型。第一个项目是 Runway 和 NVIDIA 联合开发的一个基础模型。世界模型说白了就是让 AI 能理解物理规律、预测下一步会发生什么、并据此行动,Runway 说这是他们从第一天就在押...

推荐理由:我会先打个折:正文只给了个标题和一句话摘要,没披露模型规模、训练数据、许可证和任何跑分,所以没法判断实际能力。但 Runway 加 NVIDIA 这个组合,加上“开源物理世界模型”这个定位,确实戳中了机器人、具身智能那帮人现在最头疼的事——没有好用的开源基础模型。这点先别太激动,等他们把模型和协议放出来再看。

AI HOT 精选

英伟达开源 Cosmos 3:一个能看懂物理世界、还能生成动作的 32B 模型

英伟达把 Cosmos 3 称为第一个完全开放的物理 AI 全能模型,意思是它不只能识别图像,还内置了视觉推理、生成 3D 世界状态和直接输出动作的能力。这次放出两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提训练数据规模、具体跑分和推理成本,所以实际能用多好、跑起来贵不贵还得等实测。

推荐理由:我会先打个折:正文是单篇发布稿,没给基准测试、没提许可证细节,也没说训练数据规模和实际部署条件,所以分数卡在 78–84 区间。亮点在于 NVIDIA 第一次把视觉推理、世界生成和动作生成打包成一个开放物理 AI 模型,并给出两个具体尺寸,这对机器人圈子的信号意义不小。但缺少验证信息,这点先别太激动。

AI HOT 精选

MiniMax 开源 M3 模型:一个模型搞定编程、100 万 token 上下文和原生多模态

MiniMax 把 M3 模型开源了,权重公开可下载。它把三个能力塞进了一个模型里:编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边(SWE-Bench Pro 得分 59.0%),能处理 100 万 token 的超长上下文,还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

推荐理由:MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案,上下文窗口拉到100万token。最实在的点是MSA注意力机制,每token计算成本降到前代的1/20,长文本推理能省不少钱。编码和Agent跑分看着不错,但正文没给出具体对比对象和测试细节,这点先别太激动。整体是一次有诚意的开源发布,信息量够,但验证还缺一环,所以放在featured而不是P1。

AI HOT 精选

Qwen3.7-Plus:一个能看图、写代码、操作界面的多模态智能体模型

Qwen 发布了 Qwen3.7-Plus,把视觉理解和语言能力塞进同一个模型里,让它能直接看懂屏幕、操作手机 App、根据截图写前端代码,还能在命令行和图形界面之间来回切换干活。在 Terminal Bench 2.0 终端任务上拿了 70.3 分,比 Opus 4.6 Max 和 DeepSeek-V4-Pro Max 都高;在 Deep-Plan...

推荐理由:我会先打个折:正文只给了功能清单,没给任何硬指标。7 类能力听着挺全,聊天、看图、读文档、搜网页、调工具都塞进去了,但没参数、没价格、没上线日期,等于只看了个目录。这点先别太激动。不过 Qwen 这条线每次更新都会牵动国内从业者的注意力,尤其是把多模态和智能体绑在一起推,说明他们想在应用层抢身位。信息虽然薄,但话题本身够热,放在 featured 里提醒大家盯后续是合理的。

彭博科技

一个 29 岁游戏玩家创办的 3D 建模公司 Vast 刚拿了近 2 亿美元,估值冲到 10 亿,成了中国最新的 AI 独角兽

Vast 这轮融了将近 2 亿美元,估值达到 10 亿美元,正式跨进独角兽门槛。创始人是个 29 岁的游戏玩家,公司做的是用 AI 生成 3D 模型。不过正文没披露具体投资人是谁,也没说产品参数、技术路线和实际客户规模。光看融资金额和估值,在当下市场能拿到这个体量的钱,说明资本对 AI 驱动的 3D 内容生产方向还挺买账的。但没看到产品落地和收入数据,...

推荐理由:这条消息的钩子很足——创始人身份和估值数字都够直接。我会先打个折:正文没披露投资方是谁,也没说产品到底什么参数、效果怎么样,所以只能当融资信号看,别急着把它当成技术突破。对从业者来说,知道又一家 3D 方向的公司在拿大钱就够了,剩下的等产品出来再判断。

OpenAI News

OpenAI 封禁一批疑似来自中国的账号,这些账号用 ChatGPT 生成评论和漫画,干预美国科技政策与关税讨论

OpenAI 在 2026 年 6 月的威胁报告里披露,他们封掉了一批 ChatGPT 账号,这些账号很可能来自中国。操作者用简体中文写提示词、挂 VPN,让模型批量生成英文短评和政治漫画,主要攻击美国的关税、稀土、AI 和 5G 政策,并明确要求漫画里只能出现特朗普,不能出现中国或习近平。同一批账号还生成中文“水军”内容,攻击美国和以色列,放大反犹太...

推荐理由:OpenAI 自己发的威胁报告,把一起疑似来自中国的 AI 影响行动说得有鼻子有眼,手法、目标、规避策略全抖出来了。这事踩中了 AI 安全、地缘政治和内容审核三条敏感线,但本质上是一份安全事件通报,不是产品突破或技术论文,所以分数卡在 78 分这个区间,没往上走。

5月31日星期日

新智元 · 公众号

复旦系团队发布时空一体世界动作模型 STI-WM,称能同时吃进 RGB、点云和本体感知数据做百秒级任务规划

这篇文章来自微信公众号,但页面被环境验证挡住了,正文内容完全看不到。标题和摘要里提到的“复旦铁三角”和“最优物理 AI 路径”都是原文的说法,具体技术细节、实验数据和模型架构都没法核实。已知信息是:一个叫 STI-WM 的模型,主打时空一体的世界动作建模,用在机器人上,支持 RGB 图像、点云和机器人自身状态感知三种输入,能做上百秒的任务规划。另外还提...

推荐理由:这篇东西我会先打个折——全是公司自己说的,没给公开 benchmark 也没说模型能不能复现。但信息量确实不小:STI-WM 把视觉、点云和机器人自身状态揉进一个模型里,号称一次能规划上百秒的动作,这比现在多数 demo 里几秒的规划长得多。半年融了 5 轮、Pre-A 轮 3 个亿,还拉了 NVIDIA 站台,资本侧的信号比技术侧更实。对做机器人落地的人,这条至少能看出一条技术路线和资源密度,所以放在 featured 门槛上。

量子位 · 公众号

复旦系团队发布机器人世界动作模型 STI-WM,把时空信息揉在一起做长任务

沐神智能搞了个叫 STI-WM 的模型,专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态(比如关节角度)同时喂进去,首创了时空一体的架构,不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演,中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数,也没提部署成本,所以实际效果和性价比还得等更多数据。

推荐理由:我会先打个折:正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的,这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构,直接做百秒级推演,这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队,英伟达也出现在标签里,产业和学术两边都有点关联。综合来看,信息够新、够具体,但验证强度不明,所以放在 featured 门槛附近,不往上拔。

5月30日星期六

AI HOT 精选

有人用 AI 生成假黑人形象,在 TikTok 上卖 Shein 的廉价货

The Verge 记者发现,TikTok、Facebook 和 Instagram 上出现了一批用 AI 生成的“黑人创作者”账号,比如一个叫“Aliyah”的虚构人物,假装是手工匠人,实际在卖 Shein 上 9 美元批来的皮带扣,转手标价 40 美元。这些账号靠 AI 头像和编造的身份故事,利用人们对黑人手工品牌的支持心理来赚差价,本质上就是数字...

推荐理由:这事抓人眼球的地方在于骗术够具体:AI 捏出一整套黑人创作者人设,专门瞄准“支持手工原创”的善意去卖劣质货。跨三个平台铺内容说明操作门槛低、可复制性强,但正文没给受骗人数或金额,所以严重程度得打个折。安全风险是实打实的,合成身份加代发货这套组合拳,平台现在很难防。

AI HOT 精选

Google 把两个新图像模型 Nano Banana Pro 和 Nano Banana 2 挂上了 Gemini API

Google AI Developers 发推说 Nano Banana Pro(对应 gemini-3-pro-image)和 Nano Banana 2(对应 gemini-3.1-flash-image)已经正式发布,可以直接通过 Gemini API 调用。推文里贴了一些社区示例展示效果,但正文没披露定价、跑分、单次生成耗时或调用频率上限,想上...

推荐理由:我会先打个折:这就是个产品更新,不是技术突破。Google 把两个图像模型挂上 Gemini API 标成生产可用,对想用的人是个信号,但正文没披露价格、没给跑分、也没说调用限制,所以没法判断性价比。名字叫 Nano Banana,听着像玩梗,但背后就是 gemini-3-pro-image 和 gemini-3.1-flash-image,别被名字带偏。

量子位 · 公众号

帮 Gemini 拿下 IMO 金牌的建模负责人,差点去当了职业钢琴家

这篇文章讲的是 Yi Tay,他在 Gemini Deep Think 拿到 IMO 金牌级成绩时担任建模联合负责人。他 2023 年参与创立了 Reka AI,639 天后又回到了 Google DeepMind。文章还提到他 2012 年就考过了 Trinity 古典钢琴副学士文凭,差点走上职业演奏的路。不过正文因为微信环境验证拦截,具体技术细节和...

推荐理由:这是一篇人物特写,不是 Gemini 能力发布稿。核心价值在于 Yi Tay 在 IMO 金牌成果里的具体角色、他创办 Reka 又回归的经历,以及 639 天这个精确时间跨度。文章没展开技术细节,所以重要性停在人物和行业信号层面,76 分放在 featured 档是合适的。

机器之心 · 公众号

苹果搞了个叫 PICO 的图像压缩方案,画质不变,文件能小到三分之一

苹果发了篇论文介绍 PICO,一个用 AI 做图像压缩的编解码器。在主观画质差不多的情况下,它比 AV1、VVC 和 JPEG AI 省 57% 到 70% 的码率,也就是说文件体积能压到原来的三分之一甚至更少。在 iPhone 17 Pro Max 上跑,压一张 1200 万像素的照片要 230 毫秒,解压要 150 毫秒。正文没具体讲模型结构和训练...

推荐理由:HKR 三项都成立:PICO 有明确的 57%–70% 码率节省和 230 毫秒端侧编码数据,不是纯概念。但正文没提产品化时间,目前还是研究发布,所以分数放在 78–84 这个区间。

机器之心 · 公众号

英伟达和清华的 γ-World 把世界模型从单机改成了联机,登顶 HuggingFace 日榜

这篇推文本身因为微信环境验证没抓到正文,我只能根据已有的英文摘要和标题来还原。γ-World 是一个多智能体世界模型,核心是把多个 AI 角色放在同一个虚拟环境里互动。它用了一种叫“单纯形位置编码”的方法和 hub token 机制,把多个智能体之间的交互计算成本从平方级降到了线性级。说人话就是:以前每加一个角色,系统要算它和所有其他角色的关系,开销涨...

推荐理由:我会先打个折:这是研究发布,还没看到大规模落地验证,但技术点够具体。Gamma-World 解决的是多个 AI 同时在一个世界里交互时计算量爆炸的问题,用正单纯形位置编码让每个智能体知道彼此位置,再靠 hub token 汇总信息,把原本 O(n²) 的复杂度压到 O(n)。8 个玩家延迟压到 4.5ms 这个数挺实在,说明小规模场景已经能跑顺。不过正文没披露更多玩家数下的表现,这点先别太激动。整体属于有干货、有数字、方向对路的研究,给 featured 合理。

AI HOT 精选

OpenAI 放出一个实时翻译语音模型,70 多种语言输入,13 种语言输出

OpenAI 发了 gpt-realtime-translate,一个专门做语音翻译的模型。你对着它说 70 多种语言里的任意一种,它能直接用 13 种目标语言把语音播出来。OpenAI 说大模型虽然强,但特定任务还是得上专用模型。目前这个功能已经在智能眼镜上跑起来了,不过正文没披露延迟、准确率和具体硬件细节。

推荐理由:我会先打个折:正文没提延迟、定价和 API 开放时间,所以实际能不能用、贵不贵还不知道。但 OpenAI 把实时翻译塞进智能眼镜,70多种语言进、13种语言出,这个组合本身是个挺实在的进展,值得从业者看一眼。

The Verge · AI

想拍你干家务,AI 公司开始用免费保洁换训练数据

一家叫 Shift 的 AI 训练初创公司说,可以免费给纽约人打扫房子,条件是允许他们拍摄保洁员干活的全过程:洗碗、擦台面、掸灰、拖地。这些视频会被用来训练家用机器人。公司还计划扩展到伦敦等城市。但正文没披露用户隐私条款、数据保留期限、后续收费模式,也没说具体什么时候进新城市。我会先打个折:免费保洁听着不错,但等于拿你家当机器人训练场,值不值得自己掂量。

推荐理由:我会先打个折:正文没披露视频拍到什么程度、数据保留多久、会不会扩到别的城市,所以别急着说这是机器人数据的灵丹妙药。但 Shift 这个做法确实戳到了一个真问题——教机器人做家务,缺的就是人在真实厨房里刷碗擦台面的视频。用免费保洁来换,比花钱买数据便宜,也比实验室摆拍更像真活。对从业者来说,看点在于这种采集方式能不能规模化,以及用户到底愿不愿意让陌生人架着相机看自己家。这点先别太激动,等他们公布授权条款和隐私处理再说。

5月29日星期五

The Verge · AI

Shift 用免费上门打扫换机器人训练数据,清洁工会全程被录像

一家叫 Shift 的 AI 训练数据公司说,可以免费帮你打扫家里,条件是让他们录下清洁工擦窗、吸尘、整理的全过程,拿这些视频去训练机器人。他们觉得这些数据的价值足够覆盖服务成本,网站上写的是“你得到干净屋子,我们拿到训练数据,双赢”。宣传片里清洁工戴着一顶有点奇怪的帽子干活。不过正文没提服务覆盖哪些城市、怎么处理隐私和知情同意,也没说已经收集了多少数...

推荐理由:HKR-H 和 HKR-R 都很实在:Shift 把家政服务直接变成机器人数据采集管道,话题性够强。HKR-K 有明确机制,但城市范围、隐私条款、数据集规模正文都没披露,所以先别太激动,暂时放在低曝光位。

The Verge · AI

Adobe 的对话式 AI 助手像个平庸的设计实习生

The Verge 提前试了 Adobe Firefly AI 助手的测试版。它不像常规 AI 工具那样直接生成图片或视频,而是充当一个中间人,用对话的方式替你操作 Adobe 的设计软件。作者说,助手解释每一步编辑思路时讲得很清楚,但最终做出来的效果并不让人满意。正文没提定价、正式上线时间,也没列出完整支持哪些软件。

推荐理由:我会先打个折:这是 The Verge 编辑亲自上手 Adobe Firefly AI Assistant 测试版的体验文,不是官方通稿。它能在 Adobe 设计软件里听指令改图,解释流程挺清楚,但成品确实一般,所以标题才叫“平庸的设计实习生”。这点先别太激动,正文没披露定价、什么时候正式上线、具体支持哪些应用,信息有缺口。不过它踩中了设计工作自动化的敏感点——能不能用、好不好用、会不会抢活,所以给到 featured 门槛的分数是合理的。

AI HOT 精选

小米开源 ControlFoley:给视频配音效,可以按你写的提示词或给的参考音频来

小米大模型应用团队放出了一个叫 ControlFoley 的视频音效生成模型,权重和代码都开源了。它主要解决一个问题:以前模型只能看画面自动猜配什么声音,创作者没法干预。ControlFoley 支持三种用法——用文字描述想要的音效、用文字强行覆盖画面里原有的声音、或者上传一段参考音频让它模仿音色和风格,同时还能保证声音和画面动作对得上。团队自己训了一...

推荐理由:ControlFoley 把视频拟音做成可控生成,还直接开源了全套,对创作者和开发者都挺友好。它不是那种刷榜的基础模型发布,但胜在任务明确、工具属性强,放在 featured 门槛附近是合理的。

AI HOT 精选

谷歌 DeepMind 老大说 AGI 可能三年内到,但社会还没准备好

哈萨比斯判断,通用人工智能(AGI)最快 2029 到 2030 年就会出现,比之前想的快很多。他说的 AGI 不是只会干一件活的专用 AI,而是能像人一样跨领域学习、推理和创造的系统。现在那些能独立干活的 AI 智能体,在他看来就是 AGI 的预演。不过他也把话说得很清楚:AGI 不会突然蹦出来,而是一段持续加速的升级过程。他更担心的是,各国政府和社...

推荐理由:哈萨比斯这次把 AGI 时间线压到 2029-2030,比很多人的预期要快。他点出多模态和自主决策是硬指标,但正文没展开讲现在卡在哪、验证标准是什么,所以这个预测更像个人判断而非有数据支撑的路线图。我会先打个折:方向值得关注,但别当倒计时看。