跳到正文

#多模态

今日 1 条

4月29日星期三

量子位 · 公众号

UCL 等团队开源 Avenir-Web,一个不用额外训练就让网页智能体干活更稳的框架,在 ONLINE-MIND2WEB 上跑到 53.7%

Avenir-Web 是 UCL、普林斯顿和爱丁堡大学一起开源的一个网页智能体框架,主打不训练、直接给模型套上就能用。它在 ONLINE-MIND2WEB 这个包含 136 个网站、300 个真实在线任务的测试里,成功率做到了 53.7%。对比一下,用 Gemini 3 Pro 跑的时候,它比 Claude Computer Use 3.7 的 47....

推荐理由:HKR 三项都站得住:标题有记忆点,数字和对比够具体,选题踩中网页智能体可靠性和模型选型这两个从业者高频焦虑点。这是开源研究发布,不是大厂模型首发,82 分放在 78–84 区间合理。

量子位 · 公众号

DeepSeek 多模态模型开始灰度测试,能识别图片里的饮料和杯子

DeepSeek 研究员确认 V4 视觉版已经在灰度测试,官网首页上线了图片识别入口。一张截图显示,模型花了 4 秒识别出一张文字不多的图片里的饮料种类和杯子类型。正文没披露灰度覆盖范围、API 是否开放以及定价,所以能不能用上、花多少钱还不清楚。

推荐理由:HKR 三项都站得住:DeepSeek V4 视觉灰度测试是实打实的国内旗舰更新,有截图和 4 秒思考样本。分数维持 80,因为正文没披露开放范围、API 怎么接、价格和跑分,信息缺口不小,先别太激动。

量子位 · 公众号

生数科技认领了那个神秘登顶的机器人模型,叫 MotuBrain,在两项评测里拿了高分,还放了个三台机器人接力干活的演示

4 月中旬有个叫 MotuBrain 的模型在 WorldArena 和 RoboTwin2.0 两个榜单上突然登顶,生数科技在 4 月 29 日认领了它。RoboTwin2.0 的干净环境和随机干扰环境分别拿了 95.8 和 96.1 分。演示里用三台不同的人形机器人接力完成了五项任务,核心是一套叫“世界动作模型”的设计,把视频、动作和语言用混合专家...

推荐理由:我会先打个折:分数和 Demo 都来自公司自己,没有独立部署数据,所以 82 分不往上调。但悬念认领加三台机器人实物演示,H 轴直接拉满;RoboTwin2.0 双场景高分和三流 MoT 架构把 K 轴撑实了;视频公司跨进具身智能这条线,R 轴也站得住。整体判断没变,三个轴都过,分数保持。

r/LocalLLaMA

商汤发布 SenseNova-U1:一个原生架构同时搞定看图理解和生图,不再靠外挂适配器

商汤放出了 SenseNova-U1 系列,主打“原生统一多模态”,意思是模型内部直接处理文字和图像,不用再像以前那样给语言模型外接一个图像适配器来翻译视觉信息。这次公开了 8B 和 A3B 两种 MoT(Mixture of Tokens)规格的权重,其中 A3B 的参数量更小,适合本地跑。官方说法是这套架构把视觉理解和生成塞进了同一个模型里,但 R...

推荐理由:HKR 三项都踩实了:单体架构替代适配器这个思路有看头,4 个 MoT 模型加开源权重是实打实的新料,本地可跑的多模态模型正好戳中当下热点。但正文没给任何基准分,来源又是 Reddit,信息缺口明显,所以分数压在 74 这个 featured 门槛上,先别急着往上抬。

彭博科技

苹果要在 iOS 27 和 macOS 27 里重做照片编辑,主打 AI 修图

彭博社这篇报道的正文被付费墙挡住了,只抓到了标题和一段机器人验证页面,所以具体功能、用了什么模型、支持哪些机型、什么时候上线,正文都没披露。从标题看,苹果准备在系统自带的照片 App 里塞进一批 AI 编辑工具,关键词是“扩展、增强、重新构图”,听起来像是能自动补全画面边缘、提画质、帮你重新裁切构图。RSS 提要里提了一句这是为了跟安卓阵营的 AI 修...

推荐理由:消息来自 Bloomberg,可信度还行,而且照片编辑是系统自带的高频功能,所以 hook 和 reach 都成立。但 knowledge 这块确实撑不起来——功能细节、模型方案、上线时间全是空白,只能给到 featured 的底线分 72。

NVIDIA 博客

英伟达发布 Nemotron 3 Nano Omni:一个模型同时看懂图文、听懂语音,做 AI 代理时吞吐量号称是同类 9 倍

英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni,一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构(MoE),实际激活的参数量是 3B,配合 Conv3D 和 EVS 技术来处理音视频,上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下,跑 A...

推荐理由:NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里,还开放了权重和训练技术。我会先打个折:9 倍效率提升是跟谁比、测什么任务,正文没细说,这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置,加上直接上 Hugging Face 和 OpenRouter,对想用开源方案搭多模态 agent 的团队确实省事。单信源,信息够用但不算独家,所以放在 featured 里。

4月28日星期二

量子位 · 公众号

面壁智能发 MiniCPM-o 4.5 技术报告,12GB 消费显卡就能跑全双工音视频

面壁智能、OpenBMB、清华 NLP 和数学基础中心放出了 MiniCPM-o 4.5 的技术报告。模型参数约 90 亿,能同时处理视频、音频和文字流。核心设计叫 Omni-Flow,把不同信号放在一条统一时间线上分时复用,省掉了外挂的语音活动检测模块。报告里说,一张 12GB 显存的 RTX 5070 就能跑全双工模式,实时率做到 0.4,意味着生...

推荐理由:HKR 三项都成立:9B 全双工模型在 12GB 消费卡上跑到 RTF 0.4,靠 Omni-Flow 的时间轴对齐机制实现。不是前沿实验室的旗舰发布,但实用性强,78–84 分合理。

量子位 · 公众号

商汤开源 SenseNova-U1:不卷参数卷架构,把图像理解和生成塞进同一个模型

商汤放出了两个开源模型 SenseNova-U1,一个 8B 参数,另一个是总参数量 38B 的 MoE 版本,都用了一套叫 NEO-unify 的架构。它砍掉了传统的视觉编码器和 VAE,直接处理像素,在单张 H100 或 H200 上大概 9 秒能生成一张 2048×2048 的图。核心卖点是图文交错推理,也就是模型能边看文字边看图、边想边出图。不...

推荐理由:我会先打个折:正文没给图文交错思维链的具体效果和长文字渲染的实测,32K 上下文和连续图文 beta 也还是限制,别当成熟方案用。但去掉 VE/VAE 的像素直出设计确实有意思,9 秒出 2048 图的成本听着挺省,开源出来对做多模态的团队是个可拆可改的底子。

机器之心 · 公众号

联影智能开源了首个能看懂医疗视频的模型方案,还带了一个52万条数据的评测集

联影智能放出了 uAI-NEXUS-MedVLM,一个专门让大模型理解超声、内窥镜这类医疗视频的开源方案,配套论文中了 CVPR 2026。他们同时发布了一个叫 MedVidBench 的评测集,包含 53.2 万条视频-指令对,覆盖 8 种医疗视频来源和 8 类任务。团队拿 Qwen2.5-VL-7B 在这个数据集上做监督微调,在核心指标 CVS 上...

推荐理由:HKR 三项都站得住:真实医疗视频加首个开源方案自带话题性,53 万条数据和 89.4% 对 16.4% 的结果提供了硬信息,也切中了通用模型在专业领域拉胯、开源方案抢位的行业情绪。医疗场景的垂直属性让分数落在 78–84 区间,82 分合理。

新智元 · 公众号

NUS 和 NTU 搞了个叫 Pask 的系统,能在 1.5 秒内边听边猜你想干嘛,还带永久记忆

Pask 是新加坡国立和南洋理工联合发布的一个系统,论文编号 arXiv:2604.08000。它主要靠三个模块干活:DD、MM 和 PAS,其中 IntentFlow 这个组件能在 1.5 秒内实时检测用户意图。核心赌的是实时意图识别,而不是把执行链路拉长。不过正文因为微信页面环境异常被屏蔽了,具体技术细节、实验数据和验证结果都没披露,所以这 1.5...

推荐理由:Pask 把主动 Agent 的难点从执行链压到了实时意图层,1.5 秒检测和永久记忆是实打实的工程指标,不是概念包装。论文号、模块名都给了,信息够硬。但正文没提开源、没给 benchmark 对比、也没说有没有实际部署,所以分数先打个折,停在 78。

r/LocalLLaMA

微软放出 TRELLIS.2:一个开源 40 亿参数图生 3D 模型,能直接出带贴图的资产

微软在 Reddit 上发了个帖子,标题信息量挺大,但帖子正文被 403 屏蔽了,看不到具体细节。从标题看,TRELLIS.2 是个开源的图生 3D 模型,参数量 40 亿。它能生成最高 1536³ 分辨率的 PBR 纹理资产,也就是带物理渲染材质的 3D 模型,不是白模。技术路线上,它用了原生 3D VAE 做 16 倍空间压缩,这通常意味着生成效率...

推荐理由:标题信息量不小,但正文因为 Reddit 403 拿不到论文链接、许可证和具体评测,所以只能按标题给的事实来写。我会先打个折:1536³ 的 PBR 资产听起来挺省钱,但没看到跟现有方法的对比,这点先别太激动。40 亿参数配上 16 倍空间压缩,理论上推理会快一些,不过没实测数据就不好说实际延迟。整体判断挂在微软开源这个动作上,信息缺口是缺论文和基准,所以分数停在 featured 的底线。

4月27日星期一

The Verge · AI

Canva 的 AI 工具把设计里的“巴勒斯坦”自动改成了“乌克兰”,公司已道歉

Canva 的 Magic Layers 功能本来是把平面图拆成可编辑图层,结果被用户发现它会偷偷把文字里的“Palestine”替换成“Ukraine”。X 用户 @ros_ie9 测试时,“cats for Palestine”变成了“cats for Ukraine”,但“Gaza”这个词没受影响。Canva 说已经修了,但没解释触发机制是什么。

推荐理由:这不是常规功能更新,而是一次具体的 Magic Layers 事故。H 来自“Palestine 变 Ukraine”这种不该发生的替换;K 在于功能边界被打破,且正文没披露触发逻辑;R 则指向政治敏感和信任风险。我会先打个折,因为 Canva 只说已修复但没解释原因,信息缺口还在。

新智元 · 公众号

奥特曼喊完“红色警戒”五个月,GPT Image 2 在图像竞技场三项登顶,把谷歌甩开一大截

GPT Image 2 上线不到半天就在 Arena 图像榜拿了三个第一。文生图得分 1512,比第二名 Nano Banana 2 高出 241 分,Arena 说这是图像榜有史以来最大分差。盲测胜率 93%,文字渲染能力一口气涨了 316 分。核心变化是模型会“先想再画”:先规划构图、自己检查结果、能联网搜图,还能一次出 8 张风格统一的图。不过正...

推荐理由:GPT Image 2一上线就屠榜,分数和胜率都摆在那,1512分、93%盲测胜率、文字渲染涨316分,这些数字说明它确实把文生图拉到了新高度。我会先打个折:原生思考图像模型听起来很猛,但正文没披露具体架构和成本,这点先别太激动。不过一次生成8张连贯图、能联网搜图再画,对做设计和内容的人很实用。整体是近期多模态产品里最硬的一次更新,值得从业者盯一下。

量子位 · 公众号

Meshy 用户破千万后开始做 3D 打印实物,ARR 一年翻了 14 倍

Meshy 的注册用户超过一千万,ARR(年经常性收入)做到 4000 万美元,2025 年收入同比翻了 14 倍。他们新推的 Meshy Creative Lab 能直接生成钥匙扣、冰箱贴、键帽这类小物件的 3D 模型,但正文没披露实物下单功能是否已上线。一个值得留意的数据是:他们测了 75 个模型,在拓竹切片软件里的切片通过率达到 97%,说明模型...

推荐理由:Meshy 这次更新不是画饼,是拿钱和打印通过率说话。我会先打个折:实物订购还没上线,正文只说“进入倒计时”,这点先别太激动。但 97% 的切片通过率对 3D 打印玩家是实打实的省事信号,说明模型不是只能看,真能打。ARR 年翻 14 倍也侧面印证头部厂商已经在买单,不是靠免费用户撑场面。整体是垂直 3D AI 产品的一次公司自曝数据更新,信息量够,但没到行业地震级别,放在 featured 低位合理。

机器之心 · 公众号

苹果新论文问:多模态模型没开口的 logits 里,到底藏了多少画面信息?

苹果这篇论文直接测了一个安全问题:视觉语言模型在生成回答前,内部那串“候选词概率”(logits)会不会把图片细节漏出去。他们在 CLEVR 和 MSCOCO 上做实验,发现只靠排名前 30 到 80 的 logits 值,就能反推出图片里有没有噪声、目标物体的特征,甚至部分背景属性。风险点在于,现在有些灰盒 API 会返回 top-k 的 log 概...

推荐理由:我会先打个折:这不是一个能直接拿来用的攻击工具,更像一次扎实的探针实验。但它的价值在于把“logits 能泄密”从直觉变成了可量化的证据,30–80 这个范围让风险变得具体。对做 VLM API 的团队来说,如果还在对外吐 top-k 对数概率,这篇论文值得立刻看一遍。

机器之心 · 公众号

Meshy 6 发布,这家靠 99 行代码复刻冰雪奇缘起家的公司,现在在欧美 3D AI 市场占了六成份额

Meshy AI 发了 Meshy 6,正文没披露具体技术细节。公司说自己在欧美发达市场占有率超过 60%,三年积累了 1000 万用户、年经常性收入超 4000 万美元,用 AI 生成了 1 亿多个 3D 模型。37 互娱用下来,基础雕刻工作量少了 30% 到 40%,说明工具确实能嵌进美术管线里省人力。不过文章因为环境异常没加载出完整内容,产品实际...

推荐理由:我会先打个折:欧美市场份额超60%是公司自己说的,正文没给第三方数据或基准测试,这点先别太激动。但 Meshy 6 的看点不在那个份额,而在三七互娱给出的30%到40%雕刻工作量减少,这是实打实的生产环节反馈。1000万用户和4000万美元 ARR 说明商业化跑起来了,对做 3D AI 工具的人有参考价值。整体信息量够,但缺独立验证,所以放在 featured 低段。

4月25日星期六

Hacker News 首页

Google 上线 Flow Music,用 Lyria 3 做歌、Veo 生成 MV

Google 悄悄上线了 Flow Music 网页版,目前有歌曲、歌单、空间、视频、项目和 Turntable 六个板块。核心功能是跟一个叫 Producer 的对话式工具聊天做歌,官方说它背后是 Lyria 3 模型,能生成带人声的完整歌曲;AI 音乐视频部分接的是 Veo 模型,可以自己控制角色和画面风格。页面还展示了一些示例曲目和可交互的迷你乐...

推荐理由:我会先打个折:正文没披露价格、地区、模型参数和版权机制,这些关键信息全缺,所以重要性停在 76 不动。但 Google 把 Lyria 3 和 Veo 打包成一个网页端音乐创作入口,6 类入口直接列出来,Producer 能出完整歌曲,这点对从业者来说信号很明确——大厂在认真推 AI 音乐工具,不是 demo。没写版权怎么处理,先别太激动,但上线本身已经够让做音乐 AI 的人盯着看了。

TechCrunch · AI

ComfyUI 拿了 3000 万美元,估值冲到 5 亿,卖点是让创作者自己搭 AI 生图/视频的工作流

TechCrunch 消息,ComfyUI 刚融了 3000 万美元,估值 5 亿。它的工具不是又一个模型,而是给创作者一个可视化节点界面,像搭乐高一样把 AI 生图、视频、音频的步骤串起来,精细控制出图效果。正文没披露投资方、融资轮次、具体定价和发布时间,所以这笔钱到底怎么花、商业化节奏如何,现在还不清楚。

推荐理由:TechCrunch 报了 3000 万融资和 5 亿估值,让可控媒体工作流从爱好者圈子变成正经市场信号。我会先打个折——投资方、轮次、定价、发布时间表正文都没披露,所以别急着对标大模型公司。真正值得盯的是它把控制权还给创作者,而不是又一家拼生成效果的模型厂。

Hacker News 首页

TIPSv2:Google DeepMind 给视觉语言模型换了套预训练配方,零样本分割涨了 14.1 分

Google DeepMind 发了 TIPSv2,一篇 CVPR 2026 论文,改了三处预训练方法,让视觉模型在零样本分割上明显变强。核心发现是:用蒸馏训练出来的小模型,在图像区域和文本的对齐能力上反而超过了大模型老师,原因在于老师模型在预训练时没管那些没被遮住的图像块。于是他们搞了个 iBOT++,把自监督学习的目标从只盯被遮住的块,扩展到所有图...

推荐理由:Google DeepMind 在 CVPR 2026 拿出的 TIPSv2,核心是三处预训练改动。最值得看的是 iBOT++:对遮挡和可见 patch 都加自蒸馏损失,零样本分割直接涨了 14.1 mIoU,同时用 Head-only EMA 把训练参数砍掉 42%。我会先打个折——这还是一次研究发布,不是当天就能用的模型,但可见 token 监督这个方向比堆大教师模型务实,对想省预训练成本的人是个信号。

The Verge · AI

一本新书复盘了 Maven 项目:美军是怎么从嫌弃 AI 到离不开它的

Katrina Manson 的新书梳理了 Maven 项目从 2017 年用计算机视觉分析无人机视频起步,到后来演变成 Maven Smart System 的全过程。书里最抓眼球的一个数字是:在对伊朗行动的头 24 小时里,美军靠这套 AI 系统辅助打了一千多个目标,规模差不多是二十年前伊拉克“震慑”行动的两倍。不过这篇采访没提现在用的是哪家公司的...

推荐理由:这篇讲的是美军怎么从 2017 年用 Project Maven 看无人机画面,走到今天靠 AI 系统加速生成打击目标。我会先打个折:正文没披露当前用的模型、供应商换过没有、部署范围多大,所以分数停在 74。但 24 小时打 1000 多个目标这个数字很直观,差不多是 20 多年前伊拉克“震慑行动”的近两倍,能让人立刻感受到 AI 在实战里的介入程度。Katrina Manson 的新书追溯了这段历史,不过细节缺口明显,这点先别太激动。

4月24日星期五

机器之心 · 公众号

复旦等团队提出 HERMES:把 KV 缓存当分层记忆用,流式视频理解首 token 延迟最高降 10 倍

这篇讲的是复旦大学、上海科学智能研究院和新加坡国立大学一起搞的 HERMES,一个不用重新训练就能加速流式视频理解的框架。核心思路是把模型里的 KV 缓存(你可以理解成模型在推理时记下的“草稿纸”)重新组织成三层记忆:当前帧的短期记忆、最近几帧的中期记忆,以及更早帧压缩后的长期记忆。同时它做了跨层记忆平滑和位置重编号,让模型读这段压缩历史时不会因为位置...

推荐理由:我会先打个折:这是学术研究,不是产品发布,所以重要性停在 82。但 HKR 三项都站得住——10 倍提速是实打实的标题钩子,68% token 削减和 27-29ms TTFT 是能拿来算账的数字,而且方案免训练、开源,对做流式视频落地的团队来说,省 token 就是省钱,低延迟就是体验。正文没披露长视频下的记忆退化情况和更多模型上的泛化结果,这点先别太激动,但现有数据已经够让做实时视频 agent 的人认真看一遍。

机器之心 · 公众号

机器人跑赢人类马拉松后,资本开始从硬件转向“大脑”

荣耀的人形机器人“闪电”在北京亦庄半马跑出50分26秒,比人类男子世界纪录57分20秒还快。宇树H1在1.9公里弯道赛段也跑出4分13秒。文章说2026年一季度具身智能融资近200笔、总额超300亿元,4月16日灵初智能又拿了4.55亿美元Pre-A轮。信号很直接:钱正从机器人本体流向模型和智能系统,硬件能卷的差不多到头了。

推荐理由:文章用一个直观的比赛成绩开场,然后落到融资数据和行业判断上,没有空谈概念。我会先打个折:正文没交代机器人是在什么规则、什么路况下跑的,和人类纪录的直接对比要谨慎看。但Q1融资规模和它石智航那笔大额Pre-A轮是实打实的新信息,加上“硬件护城河变浅、大脑才是下半场”这个判断,对关注具身智能方向的人有提醒作用。整体是评论性质,不是一手产品发布或论文,所以放在featured。

新智元 · 公众号

谷歌和何恺明团队搞了个 Vision Banana,想把所有视觉任务统一成“生成像素”这一种操作

Vision Banana 是谷歌 DeepMind 跟何恺明他们一起做的视觉模型,核心思路是用一套“像素生成”的界面去覆盖检测、分割、生成和编辑这些活,不再每种任务单独搞一个模型。文章里给了两组跟 Nano Banana Pro 的对比数据:在 GenAI-Bench 上人类偏好胜率 53.5%,在 ImgEdit 上胜率 47.8%,说明生成和编辑...

推荐理由:我会先打个折:训练数据规模和全量基准结果正文没披露,所以别急着对标完整模型。但真正值得盯的是接口变化——Google DeepMind 跟何恺明他们搞的这个 Vision Banana,把检测、分割、生成、编辑全统一成像素输出,不再往模型上挂一堆任务头。给的两组数字,GenAI-Bench 上对 Nano Banana Pro 人类评估胜率 53.5%,ImgEdit 上 47.8%,说明在生成和编辑任务上跟对手互有胜负,不是碾压。训练只提了混入少量可逆格式任务数据,具体配方没展开。对做多模态模型的团队来说,这个统一像素接口比具体分数更有嚼头,因为...

Hacker News 首页

GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos,而且人人都能用

安全公司 XBOW 用真实漏洞库测了 GPT-5.5,漏报率压到 10%,比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是,GPT-5.5 不看源码(黑盒)的效果已经超过了 GPT-5 看源码(白盒)的水平;一旦给它源码,性能直接拉爆,把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里,它登录成功的交互轮次只有...

推荐理由:我会先打个折:数据来自 XBOW 自家的漏洞基准,不是 OpenAI 官方发布,所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%,比 GPT-5 有源码时的 40% 低了一大截,也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%,登录目标系统需要的尝试次数直接砍半,说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力,这点先别太激动,正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说,这个信号足够盯紧了:模型在没看到源码的情况下已经能...

4月23日星期四

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

新智元 · 公众号

踏石智航拿了4.55亿美金Pre-A轮,红杉和高瓴一起领投

踏石智航在4月16号宣布完成4.55亿美元Pre-A轮融资,红杉中国、高瓴创投和美团联合领投。这笔钱创下了国内具身智能单轮和Pre-A轮融资的纪录。公司说他们的AWE3.0四模态模型把没见过视角的任务成功率提升了3倍,执行抖动降低了约45%,A1机器人还拿了个一小时完成亚毫米线束组装的吉尼斯纪录。不过正文没披露估值和具体交易条款,模型、数据和实际部署能...

推荐理由:这条我会先打个折,因为所有关键指标都是公司自己说的,正文没披露本轮估值和具体交割条件,外部验证也缺。但4.55亿美金这个数本身就够硬,红杉高瓴联手领投在具身智能里不常见,AWE3.0给的3倍成功率和45%抖动下降如果是真的挺省钱,A1那个吉尼斯纪录也说明在往工厂场景走。所以HKR三条都过,分数维持83,不升P1就是因为信息源单一,等第三方复现或估值细节出来再调。

Hacker News 首页

Flipbook:一个完全由图片模型实时生成的无限视觉浏览器

Flipbook 把整个网页变成一张张像素图片,你点击任何地方,它都会生成一张更深一层的新图片,没有 HTML、没有代码、没有文字图层。所有文字都是图片模型直接画出来的,所以偶尔会画歪或写错,这点随着模型变强会改善。内容来自智能体联网搜索和模型自己的知识,准确度大概跟用 ChatGPT、Gemini 这类对话产品查到的差不多。团队说他们做这个是因为现在...

推荐理由:我会先打个折:正文没披露延迟、成本、模型栈和实际用量,所以分数停在 76。但 Flipbook 这个实验值得盯,因为它把网站变成了一串实时生成的像素图,点击哪里就继续画哪里,连文字都是画出来的,不是叠上去的。信息来自 agentic 网页搜索加模型知识,交互机制比普通生成式 UI 激进得多。视频流功能目前还是高耗资源的实验开关,这点先别太激动。

4月22日星期三

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

Latent Space

OpenAI 发布 GPT-Image-2,图像生成模型开始能看懂文字、画 UI 和做排版了

OpenAI 正式推出了 GPT-Image-2,在 ChatGPT、Codex 和 API 里都能用。这次更新最明显的变化是文字渲染、排版和编辑能力大幅提升,能直接生成幻灯片、信息图、UI 稿和二维码,还支持多语言。模型分“思考”和“不思考”两个版本,思考版可以自己上网搜资料、生成多个候选图并自我检查。在 Arena 的图像排行榜上,GPT-Imag...

推荐理由:OpenAI 把 GPT-Image-2 同时铺到 ChatGPT、Codex 和 API,还特意强调 thinking 版本和文字渲染、布局编辑这些实用能力。Arena 上 Elo 1512、领先第二名 242 分,这个差距不小,说明在盲测里用户确实更愿意选它。我会先打个折——Arena 分数受采样和用户群影响,不能直接当绝对性能看,但三个第一同时拿下,至少说明在文生图这个赛道上它目前压了别人一头。对从业者来说,能不能稳定出可编辑、多语、带 QR 码的图,比单纯画质更重要,这条更新直接踩中了选型决策点。

X · @dotey(宝玉)

OpenAI 图片生成升级到 2.0,能听懂复杂指令、写对多国文字,所有 ChatGPT 和 Codex 用户都能用了

ChatGPT 的图片生成功能今天全面升级到 2.0,免费用户也能用。这次最大的改进是能处理复杂构图了,比如带文字的 UI 界面、密集排版,小字和图标渲染比之前靠谱很多。输出分辨率最高 2K,宽高比从 3:1 到 1:3 都支持,做横幅海报可以直接出图。多语言文字生成也有提升,OpenAI 说中文、日文、阿拉伯文这些非英文文本能写得语义连贯,不再乱码。...

推荐理由:这是一次有料的 OpenAI 产品更新:ChatGPT Images 2.0 同时铺到 ChatGPT、Codex 和 gpt-image-2 API,分辨率、宽高比、非英文文字稳定性都有具体数字,thinking 模式还加了联网搜索和自检。HKR 三项全中。不过原文是短摘要式转载,没写价格,也没说 thinking 模式什么时候给 Enterprise 用,这点先别太激动。

X · @OpenAI

OpenAI 发了 ChatGPT Images 2.0,说画图更准、能直接拿来用

OpenAI 在 X 上官宣了 ChatGPT Images 2.0,定位是能处理复杂视觉任务、出图直接可用的图像模型。帖子提到三点升级:编辑更精细、版式更丰富,以及加入了“思考级智能”,但没解释这具体指什么能力。视频演示看起来效果不错,不过正文没披露模型规模、定价、延迟和推送范围,我会先打个折——等看到实测和成本再说。

推荐理由:OpenAI 官方发的帖文,信源权威性没问题,加上“Images 2.0”这个名头,话题性和行业影响都够,所以 H 和 R 都给了。但我把分压在 featured 门槛附近,因为这条帖文信息量太薄:没模型细节、没定价、没延迟、没基准测试、也没说清楚谁现在能用,K 完全站不住。真正值得盯的是可编辑性和版式控制这两点,但光靠这条帖文还远不到能复现的程度,先打个折观望。

彭博科技

OpenAI 发了新版生图模型,专门强化了图表和科学示意图的生成能力

OpenAI 更新了它的图像生成软件,这次的重点不是画得更美,而是让模型能更准确地生成复杂图表和科学示意图。正文没披露模型名字、发布时间、定价、跑分数据或具体技术方案,目前能看到的信号是 OpenAI 在往专业场景里推,而不是继续卷通用画质。

推荐理由:OpenAI 这次更新瞄准的是图像生成里一个高价值但一直没做好的短板——图表和示意图的准确性。Bloomberg 的信源让这条消息有了基本可信度,所以 H 和 R 都给了通过。但摘要实在太短,模型叫什么、什么时候能用、收不收费、跑分多少、怎么实现的,一概没提,K 只能卡在不过。我会先打个折:方向对了,但落地细节为零,先别太激动。

The Verge · AI

OpenAI 更新图片生成器,现在能联网搜资料来画图了

ChatGPT Images 2.0 这次最大的变化不是画质,而是能上网查资料。你选一个会思考的模型,它就能根据一个提示词生成一组图片,比如直接搜网页信息来画一本杂志封面。背后跑的是 GPT Image 2 模型,目前 Plus、Pro、Business 和 Enterprise 用户能用。正文没提什么时候全面推送、有没有用量限制、价格会不会变,这点先...

推荐理由:我会先打个折:正文没写具体上线时间、调用上限和价格变动,所以别急着算成本。但这次更新把“联网取数”和“多图生成”塞进一个工作流,等于让模型先查资料再画图,还能一次出好几张。对需要快速配图、做素材的人,这比单张生成实用得多。不过实际效果还得看联网检索准不准、多图一致性怎么样,这点先别太激动。

TechCrunch · AI

Clarifai 删掉了从 OkCupid 拿来的 300 万张用户照片,这些照片曾被用来训练人脸识别模型

Clarifai 跟 FTC 和解后,删了 300 万张照片和用这些数据训出来的模型。照片是 2014 年从约会软件 OkCupid 要来的,当时 OkCupid 的高管还投了 Clarifai。说白了就是投资人和被投公司之间私下传了用户数据,拿去训人脸识别 AI。正文没披露和解的具体条款、怎么验证删除是否彻底,也没说删模型对现有产品性能有多大影响。

推荐理由:故事钩子强,事实也扎实,合规链条是AI团队现在真得盯的事。Featured合适,但正文没写和解条款、怎么验证删除、模型受影响多大,这些缺口把分数压在70多分。

4月21日星期二

Ben's Bites

Claude 新增设计面板,问几个问题就能出原型图

Anthropic 给 Claude 加了一个“设计”标签页,会先弹出 5 到 10 个问题跟你互动,然后直接生成线框图或高保真原型。作者实测发现,传图片转设计的流程在原型模式下效果不错。目前这个功能还在研究预览阶段,有独立的使用额度,20 美元月费套餐一周大概只能跑两三次大尺寸生成。文章更尖锐的吐槽在可用性上:Claude Cowork 很多能力依赖...

推荐理由:Anthropic 给 Claude 加了个 Design 标签页,对天天用 Claude 的人是个明确的信号。文章有实测细节——5-10 轮交互出原型、图像转设计流程可用、20 美元套餐每周只够跑两三次大生成——所以 HKR 三项都站得住。但这仍然是个单功能更新,不是平台级变化,我会先打个折。真正值得盯的是产品可用性:作者点名 Claude Cowork 依赖 connectors 和 plugins,但入口藏太深,这点先别太激动,等更多用户反馈再说。

机器之心 · 公众号

Monet:让多模态模型在脑子里直接画图推理,不用每次都调外部工具

Monet 把 Qwen2.5-VL-7B 改造成 Monet-7B,核心是让模型在连续的视觉潜空间里做抽象推理,而不是每次都去调用外部画图或识别工具。训练分三步:先用 12.5 万条数据做监督微调,再用 VLPO 强化学习对齐偏好。在分布内任务上比原版模型提升 3% 到 9.75%,在分布外的抽象视觉推理上提升 2.31%。论文被 CVPR 2026...

推荐理由:这篇讲的是Monet,基于Qwen2.5-VL-7B做的一个模型,核心是让多模态模型像人一样做抽象视觉思考。它不用外部工具,而是用连续隐式视觉嵌入来搞定,这点我会先打个折——思路不新,但工程上做得扎实。论文已被CVPR 2026接收,代码、模型和125K条SFT数据都开源了,对想复现的人友好。方法分三阶段SFT加一个叫VLPO的强化学习,用偏好样本教模型学回答风格。文中说分布内任务比基座好3%到9.75%,分布外抽象视觉推理提升2.31%,数字看着还行,但别太激动,因为没披露统一榜单的完整绝对分数,不知道跟其他模型比到底排第几。真正值得盯的是它把V...

OpenAI News

OpenAI 发了 ChatGPT Images 2.0,主打文字渲染、多语言和视觉推理

OpenAI 在 4 月 21 日官宣了 ChatGPT Images 2.0,说新模型在三个地方有提升:画面里的文字更准、多语言排版更稳、能根据复杂指令做视觉推理。官方放了一堆样图,从海报、漫画到杂志内页都有,看着确实比上一代强。但正文没披露模型架构、出图分辨率、价格、延迟和具体上线时间,也没给对比数据。文字渲染和多语言到底稳不稳,还得等实际用起来再...

推荐理由:OpenAI 自己发的图像模型更新,版本号直接叫 2.0,文字渲染又是老痛点,所以热度和落地价值都够。但我会先打个折:正文只给了三项改进的标题级信息,分辨率、价格、延迟、架构和可用范围全都没披露,现在只能当个预告看。真正该盯的是文字可读性和多语一致性有没有实测提升,这点先别太激动。

Latent Space

月之暗面发布 Kimi K2.6 开源模型,在长任务执行上对标 Claude Opus 4.6

月之暗面推出了 Kimi K2.6,一个总参数 1 万亿的混合专家模型,每次推理激活 320 亿参数,支持 25.6 万 token 的上下文窗口。它主打的是长时间、多步骤的智能体任务,官方宣称能连续跑 12 小时以上、调用超 4000 次工具、并行管理 300 个子智能体。在 SWE-Bench Pro 编程基准上得分 58.6,HLE 带工具得分 ...

推荐理由:我会先打个折:SWE-Bench Pro 58.6 这个数正文没给对比基线,不知道和 Opus 4.6 的差距到底多大,这点先别太激动。但 Kimi K2.6 真正值得盯的不是基座跑分,而是它把 agent 执行时长拉到 12 小时、能并行跑 300 个子代理,这在开源模型里算往前拱了一步。国内大模型旗舰发布本身就自带信号,加上抢在 DeepSeek v4 前出牌,对关注开源模型进展的人有信息差价值,所以给到 P1。

Hacker News 首页

膨胀伪影:大模型输出的瑕疵不是压缩痕迹,而是解压时脑补过头的证据

Matt Ström-Awn 把大模型生成内容里的毛病叫做“膨胀伪影”,而不是压缩伪影。他的逻辑是:模型从模糊的训练数据里往外“解压”时,会在信心不足的地方用训练分布里的高频模式硬填,于是就有了那些套话、过度注释的代码、六指手和穿模视频。这些痕迹能当法医线索用——斯坦福的研究人员靠追踪 ChatGPT 发布后词频飙升的词(比如 commendable、...

推荐理由:我会先打个折,这是个人博客评论,不是一手研究或产品发布,所以分数停在 73。但它的钩子很巧,把 LLM 的毛病重新包装成“扩展伪影”,一下就把审美收敛和生成路径暴露的问题串起来了。文章给的数字也实在,17.5% 的论文和 16.9% 的审稿有 AI 起草痕迹,说明这已经不是小范围现象。JPG 压缩 10000 次后 PSNR 掉到 14.59 的类比虽然不算严谨实验,但直观地让人感受到反复生成带来的退化。真正值得盯的是取证价值:这些伪影不光是风格问题,还可能成为追踪生成路径的线索,这对审稿信任和内容溯源都挺要命的。