跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 321–340 条 · 共 514 条

5月12日星期二

Latent Space

Thinking Machines 发布原生交互模型:2760 亿参数,120 亿激活,实时语音不再靠外挂

Thinking Machines 终于又冒泡了,这次直接扔了个新模型 TML-Interaction-Small。总参数 2760 亿,是个 MoE 架构,实际干活时只激活 120 亿参数。它最狠的地方是把实时语音交互做进了模型骨子里,不再像以前那样给大语言模型外挂语音识别和合成模块。模型能同时听、说、看、想,用 200 毫秒一个的“微对话轮次”连续...

推荐理由:我会先打个折——基准分是 Thinking Machines 自己跑的,还没第三方复现,所以“超过 GPT 和 Gemini”先别太激动。但这条消息值得推,因为它给出了具体架构(276B MoE、12B 激活)、200ms 微轮次这个硬指标,还直接挑战了语音 agent 里常用的 VAD 方案。对正在搭实时语音管线的从业者来说,哪怕只是思路参考也有价值。

量子位 · 公众号

OpenClaw 悄悄更新,Peekaboo v3 让龙虾在 Mac 上长出手脚

OpenClaw 的 Peekaboo v3 给 Mac 加了 agent 能力,能直接截取像素级屏幕、读取 UI 位置,然后模拟点击、打字、快捷键、滚动和拖拽。它还把 MCP 服务接进了 Cursor、Claude Code 和 Codex,等于让模型能进桌面软件里干活。正文没披露延迟和准确率数据,这点先别太激动。

推荐理由:OpenClaw 的 Peekaboo v3 给 Mac agent 加了一套完整的 GUI 感知和操作原语,还打通了 MCP,让 Cursor、Claude Code、Codex 都能调用。对搞桌面自动化的开源玩家来说是个实用更新,但毕竟只是一篇 Reddit 帖子,没有论文或代码仓库佐证,所以放在 featured 低段,78 分。

AI HOT 精选

Mira 的新公司 Thinking Machines 发了个原生多模态交互模型,前台 200 毫秒一响应,后台跑长线推理

这个模型把音频、视频、文字直接吃进去,不用再靠 agent 把一堆独立模型串起来。前台交互模型每 200 毫秒处理一次输入,保持对话的实时感,用户可以随时打断;后台推理模型负责长程规划和调工具。正文没披露具体参数量、训练数据和成本,也没给评测对比,所以实际效果和泛化能力还得看后续公开信息。

推荐理由:我会先打个折:正文没披露定价、开放范围和具体 benchmark,所以只能按现有信息给到 87。亮点在于 Thinking Machines 没有只发模型权重,而是给了一套前台 200 毫秒交互节点加后台推理的分层设计,原生多模态输入不是后期缝合的。这对正在折腾实时多模态 agent 的团队来说,至少提供了一个可参考的架构思路,但没看到代码或论文之前,不宜再往上拉。

The Verge · AI

Mira Murati 的新公司 Thinking Machines 在做什么:让模型边看边听边想,实时跟你协作

Thinking Machines 周一公布了他们的方向——做“交互模型”。按他们的说法,这种模型能同时接收音频、视频和文字,实时理解、回应并行动,而不是像现在的模型那样等你打完字或说完话才开始反应。正文没披露模型规模、发布时间、定价和最终产品形态,所以这东西到底多能打、什么时候能用上,现在都还是未知数。

推荐理由:这篇帖子给出了公司方向,但正文没披露模型参数、发布时间或产品形态,本质上是一次高关注度的创业方向亮相,不是可用的模型发布。HKR 三项都踩中,但信息缺口明显,所以留在 77 分这个位置,没往上拉。

AI HOT 精选

Karpathy 聊人机交互下一步:别只让模型吐 Markdown,试试让它直接写 HTML

Karpathy 觉得现在大模型默认输出 Markdown 太简陋了,他建议直接让模型生成带排版、图形和交互的 HTML,界面会好用很多。更远的想法是“交互式神经视频”——用扩散模型实时生成能操作的画面,但他也承认这玩意儿怎么跟精确的传统软件配合还是个没解的问题。输入这边,光靠语音、文字或视频不够,得加上手势指点这类更自然的交互。在脑机接口到来之前,输...

推荐理由:Karpathy 这条推文没给数据,就是个人判断,所以重要性只能打到 featured 的及格线。但他把 LLM 输出形态的变化串成了一条线:从纯文本到带格式的 Markdown,再到能直接渲染的 HTML,最后抛出“交互式神经视频”这个方向。我会先打个折——神经视频现在连跟传统软件精确配合都做不到,正文也没说怎么解决,这点先别太激动。不过对做 AI 产品的人来说,这个框架确实能帮他们想清楚下一步该把界面做成什么样。

5月11日星期一

AI HOT 精选

Qwen-Image-2.0 技术报告:把视觉理解模型和扩散模型拼在一起,生图和改图用一个框架搞定

这篇技术报告介绍了 Qwen-Image-2.0,一个把生图和精确修图合到一个模型里的方案。它的做法是把 Qwen3-VL 当成“条件编码器”,去理解你输入的指令,再连上一个多模态扩散模型来出图。指令最长能塞进 1000 个 token。报告里说,这套架构在多语言文字渲染、画面排版质量、以及人工打分上都有提升,尤其适合文字多、构图复杂的场景。不过正文没...

推荐理由:HKR 全中:Qwen 的旗舰图像模型报告给出了具体架构、1K 令牌指令输入和编辑能力,国产旗舰模型的信号足够强,必须写。

5月10日星期日

机器之心 · 公众号

谷歌 Ted Xiao 把近十年机器人学习分成三个时代,从 RT-1 到 RT-2 再到规模化

这篇文章的正文被微信环境异常拦截了,实际内容无法读取。从标题和已有英文摘要看,Ted Xiao 的复盘主要讲谷歌机器人团队怎么从 RT-1 用 8.7 万条遥操作轨迹训练,走到 RT-2 把 50 亿到 550 亿参数的视觉语言模型改造成视觉-语言-动作策略。具体三个时代怎么划分、每个阶段踩了什么坑、规模化后效果到底提升多少,正文没披露,没法展开。

推荐理由:我会先打个折:这不是新发布,是一篇回顾性梳理,所以分数没往 80 以上走。但作者身份和内部数字让它值得上推荐位。Ted Xiao 把谷歌机器人学习拆成三个阶段,从遥操作采数据到把大模型当机器人脑子用,脉络清楚。RT-1 的 8.7 万条轨迹说明早期靠人工遥控攒数据的笨功夫,RT-2 用 5B 到 55B 的 VLM 改策略,点出了现在大家纠结的核心——模型大了能不能直接控硬件。正文没披露 RT-2 在真实场景的失败率或延迟数据,这点先别太激动。整体适合给做具身智能的人当路线图看。

r/LocalLLaMA

BeeLlama.cpp:用 DFlash 和 TurboQuant 让 Qwen 3.6 27B 在单张 3090 上跑 20 万上下文,速度翻倍

Anbeeld 发了一个 llama.cpp 的分支 BeeLlama.cpp,主要加了 DFlash(一种省显存的注意力机制)和 TurboQuant(更快的量化方案),还支持推理和视觉任务。标题里说在单张 RTX 3090 或 4090 上跑 Qwen 3.6 27B 的 Q5 量化版,能塞进 20 万 token 的上下文,速度比原版快 2 到 ...

推荐理由:我会先打个折:这些数字来自 Reddit 标题和摘要,没有独立复现,135 tps 的峰值在什么输入长度、什么 batch 下跑的也没说清楚。但就算打个七折,单张 3090 把 27B 模型塞进 200k 上下文还能跑到可用的速度,对个人开发者和小团队确实省钱。BeeLlama.cpp 看起来是在 llama.cpp 上做了 DFlash 和 TurboQuant 的工程优化,正文没披露具体技术细节和稳定性测试,这点先别太激动。整体算一次值得关注的本地推理更新,所以放在低位的 featured。

5月9日星期六

AI HOT 精选

特斯拉用视觉AI提前“看”到碰撞,让气囊和安全带更早启动

特斯拉把车上摄像头看到的画面和碰撞传感器结合起来,让安全系统能提前判断要撞车了,不等传感器确认就先把安全带收紧、气囊准备好。团队用真实事故数据和仿真回放,拿人体模型测受力,发现早一点启动保护能明显降低预估伤害。这次改进通过OTA推给车主,但正文没披露具体支持哪些车型,也没给出伤害风险降低了多少的量化数字。

推荐理由:我会先打个折:信息来自马斯克的一条帖子,正文没披露 OTA 覆盖了哪些车型、伤亡率具体降了多少、验证方法是什么。所以它更像一个值得关注的产品更新,而不是一篇必须写的硬核发布。亮点在于把视觉预判和被动安全联动,思路清晰,但缺的数据让说服力打了折扣。

AI HOT 精选

Peekaboo 3.0 发布,主打“先动手”的 Mac 操作和界面识别

Peekaboo 3.0 上线了,作者说这是 2.0 以来最大的一次更新。核心变化是把“操作”放在第一位,不再是先看再点,而是直接让模型去执行 Mac 上的任务。它把截图和界面检测统一成一个功能,CLI 和 MCP 之间的 JSON 交互也整理得更干净,快照功能有改进。作者提到去年就想做,但当时模型能力不够,现在时机到了。正文没披露定价、用了哪个模型,...

推荐理由:我会先打个折:正文没披露价格、模型细节和实际落地数据,所以判断只能停在工具更新本身。亮点是把截图和界面检测统一起来,再配上 CLI 和 MCP 的 JSON 交互,让 macOS 桌面 agent 的“看”和“动”更连贯。这点先别太激动,因为没有性能对比或用户反馈,但方向对做桌面自动化的团队有用。

量子位 · 公众号

千问AI眼镜S1上线空间3D显示和主动服务,能提醒你叫车、帮你买东西

千问AI眼镜S1这次更新加了两个新东西:空间3D显示和主动提醒。空间3D显示是行业里第一个这么做的,眼镜里看到的画面会有立体感。主动提醒的意思是眼镜会自己跳出来提示你,比如该叫车了,还能直接帮你操作叫车。这个月还会上线即时购物和拍照搜题功能。另外Wellsenn XR的数据显示,从3月8号开始,千问AI眼镜拿下了国内线上AI眼镜53%的销量,卖得最多。...

推荐理由:这是一次功能更新,不是新模型或平台发布。空间3D显示和主动服务让眼镜更像一个能干活的东西,但正文没给出具体技术细节和实际延迟数据。53%的线上销量份额来自维深,统计口径和线下情况没展开,我会先打个折。整体信息量够,但偏产品节奏,放在featured低分段比较合适。

机器之心 · 公众号

港科大和社区开源了 StarVLA,一个框架把主流视觉-语言-动作模型串了起来

StarVLA 把 VLA(视觉-语言-动作模型)里常用的主干网络、动作输出头、训练策略和评测接口都做成了可插拔的模块,不用再为不同论文各搭一套代码。仓库在 GitHub 上已经拿到 2.2k 星,支持的基准包括 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。正文没披露具体训练成本和...

推荐理由:我会先打个折:StarVLA 目前是框架级发布,不是新模型,所以权重不会给到模型首发那么高。但它的价值很实在——把多种 VLA 架构塞进同一套接口,训练和评估不用再东拼西凑,2.2k star 说明社区已经用脚投票了。正文没披露框架内各方法的横向对比数据,这点先别太激动,但统一工具这件事本身对机器人方向的工程效率提升是实打实的。

5月8日星期五

机器之心 · 公众号

英伟达和普渡大学用 agent 闭环做文生 3D 场景,让模型自己检查、自己改

这篇是 ICLR 2026 的论文,讲的是英伟达 Cosmos Lab 和普渡大学搞的 Scenethesis 框架。它让语言和视觉模型组成一个 agent 闭环,根据文字描述生成 3D 场景。流程里加了视觉定位、基于 SDF 的物理约束,还有一个裁判模块来挑错。实验数据是:首次生成成功率约 72%,模型自己检查修正后能拉到 91%,碰撞率从 6.1%...

推荐理由:我会先打个折:正文没披露 72% 和 91% 是在什么数据集上跑的,也没说 judge 模块本身会不会出错,所以这个自检提升幅度先别太激动。但思路本身挺实在——让 agent 自己生成、自己检查、自己修,相当于给文生 3D 加了个质检闭环。SDF 物理约束这个点也值得留意,它不是纯靠视觉打分,而是用几何和物理规则卡了一道,理论上能减少穿模和浮空这种低级错误。对做机器人仿真和 3D 资产管线的人来说,如果这套流程真能稳定跑通,省下来的手工修场景的时间会很可观。

AI HOT 精选

苹果带摄像头的 AirPods 进入 DVT 阶段,最快 9 月跟新 Siri 一起到

彭博社的 Mark Gurman 说,苹果那款传闻很久、自带摄像头的 AirPods 已经进入设计验证测试(DVT)阶段,外形和功能基本定型了。左右耳机各塞了一颗低分辨率摄像头,不是用来拍照,而是给 Siri 当“眼睛”,让你对着眼前的东西直接提问,比如看到一堆食材问能做什么晚饭。耳机柄为了塞摄像头比 AirPods Pro 3 稍微长一点。原计划上半...

推荐理由:HKR 三项都踩中了,但这是未确认的硬件传闻,不是苹果官方发布。DVT 状态、摄像头设计和 Gemini 合作细节让它够格进 featured,不过我会先打个折,放在低分段。正文没披露摄像头具体参数和 Gemini 合作形式,这点先别太激动。

The Verge · AI

苹果带摄像头的 AirPods 快量产了,主要给 Siri 当眼睛用

Mark Gurman 爆料,带摄像头的 AirPods 已经进入 DVT(设计验证测试)阶段,离 PVT(生产验证测试)只差一步。苹果内部测试人员正在用原型机,摄像头不拍照片或视频,只捕捉低分辨率画面,用来帮 Siri 回答“这菜怎么做”之类需要看东西的问题。正文没披露具体像素、延迟和功耗数据,也没说什么时候上市。

推荐理由:H/K/R 全过:Gurman 和 The Verge 给出了一个 DVT 阶段的苹果 AI 硬件更新,不是发布,所以分数压在 72–77 区间。带摄像头的 AirPods 这个形态够怪,容易让人记住;DVT 到 PVT 的进度和“只采低分辨率视觉信息、不拍照不录像”是实打实的新事实;它同时碰到多模态、隐私和 AI 硬件入口三条线,对做端侧和多模态的人有参考意义。

彭博科技

苹果带摄像头的 AirPods 已进入后期测试,想做成 AI 时代的穿戴设备

彭博社拿到消息,苹果把带摄像头的 AirPods 推进到了后期开发阶段。这可能是苹果第一款明确为 AI 场景设计的穿戴设备,但报道没公布摄像头具体参数、工作原理和发布时间。我会先打个折:目前只有进度信息,产品能不能落地、怎么用 AI 都还是未知数。

推荐理由:消息来自彭博,加上带摄像头的 AirPods 这个设定,H、K、R 都站得住。分数定在 72–77 区间,是因为只说了后期测试,没给规格、没讲 AI 怎么跑、也没提什么时候发,信息密度有限。

5月7日星期四

AI HOT 精选

商汤 SenseNova-U1 开源 8 步蒸馏 LoRA,扩散模型推理从 23 秒压到 2 秒

商汤把扩散模型常用的 100 步生成流程蒸馏到只剩 8 步,GPU 上跑一张图从 23 秒降到 2 秒,快了 11 倍。做法是训了一个 LoRA 权重,直接挂到模型上就能用,不用改原模型结构。配套给了 ComfyUI 工作流,覆盖文生图、改图和交错生成。正文没提具体画质对比和什么显卡跑的,这点先别太激动。核心信号不是参数堆得多大,而是用蒸馏换延迟,让扩...

推荐理由:我会先打个折:这只是图像生成领域的推理加速,不是通用模型突破,所以放在featured而不是P1。但它的钩子很实在——用8步蒸馏LoRA把扩散模型从100步砍到8步,GPU推理从23秒压到2秒,还直接支持ComfyUI。对干活的人来说,这意味着同样的卡能多跑十几倍的图,或者低配机器也能玩。正文没披露蒸馏用了多少样本、LoRA参数量多大,这点先别太激动,但开源这一步本身就让验证成本很低。

量子位 · 公众号

浙大与阿里提出 MetaCompress:只看图片就能学会压缩 Token,多轮视觉问答压缩率 90% 且精度不掉

这篇 CVPR 2026 论文介绍了一个叫 MetaCompress 的框架,专门解决多轮视觉问答里图片 Token 太多、推理太贵的问题。它的做法是让模型只看输入图片,自己生成一张“压缩映射图”,直接决定哪些视觉 Token 该留、哪些该扔,不需要额外训练一个压缩网络。文章给出的核心数据是:能砍掉 90% 的视觉 Token,同时保持回答精度不降。还...

推荐理由:我会先打个折:正文说精度不掉,但没给出具体数值和基准对比,这点先别太激动。不过思路确实干净——不用文本引导,只靠图像自身信息决定哪些视觉 Token 可以扔,压缩率做到 90%,对多轮 VQA 这种反复调图的场景很实用。浙大和阿里联合出品,挂了 CVPR 2026,研究信号够强,不是产品通稿。开源了的话,做多模态推理优化的团队可以直接拉下来测延迟和显存变化。

量子位 · 公众号

Vidu Claw 上线:一句话加一百块预算,直接生成一条广告片

生数科技把 Vidu Claw 放出来了,主打“一句话出广告片”。你给一句提示词,它能自动走完写脚本、配旁白、加音乐、剪辑合成全流程,最后吐出一条成品视频。官方拿龙虾当例子,说百元预算就能搓出“百万级”广告片,但正文没披露这个成本具体怎么算出来的,也没给实际成片链接,我会先打个折看。配套的 Video Plan 套餐每天最多能生成 40 分钟内容,覆盖...

推荐理由:我会先打个折:正文没披露生成一支片子的实际耗时和最终成本,也没给画质、可控性的横向对比,所以“百万级”更多是噱头,别太当真。但 Vidu Claw 把脚本、配音、配乐、剪辑打包成一句话工作流,还给了每天 40 分钟的生成额度,对做短视频和广告测试的人来说,试错成本确实低。龙虾广告这个例子够具体,能让人直观感受到“输入一句话、输出成片”的完整链路,比单纯讲参数更有说服力。不过没有定价细节和商用授权说明,这点先别太激动。

新智元 · 公众号

浙大与哈佛开源 UniGeo:用几何信息做相机可控的 3D 场景编辑

浙大和哈佛放出了 UniGeo 的代码、报告和在线演示。它解决的是 3D 场景编辑里一个老问题:你让 AI 换个角度生成画面,结果物体形状、位置全乱套了。UniGeo 的做法是把几何约束直接塞进模型结构、表示层和损失函数里,相当于给模型装了个空间坐标系,让它知道物体该在哪、长什么样。核心不是简单套个视频模型,而是用视频预训练里的先验知识,加上几何锚点注...

推荐理由:我会先打个折:这篇是正经的 CV 研究,不是公关稿。UniGeo 的核心不是把模型换成视频生成模型,而是在表示、架构、损失函数三层都塞进统一的几何引导,相当于给模型画了三条辅助线,让它别乱跑。视频先验加几何锚点注意力这个组合,比单纯换 backbone 有意思。开源程度不错,代码、报告、Space 都给了,在三个数据集上跟 5 个方法比过,SOTA 的说法暂时可以接住。但别太激动,正文没披露推理延迟、显存占用和实际可控编辑的失败案例,这些对从业者判断能不能用很关键。整体看,可测试性强,但离产业神经还差一截,所以 H 和 K 给过,R 不给。