跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 381–400 条 · 共 514 条

4月27日星期一

量子位 · 公众号

Meshy 用户破千万后开始做 3D 打印实物,ARR 一年翻了 14 倍

Meshy 的注册用户超过一千万,ARR(年经常性收入)做到 4000 万美元,2025 年收入同比翻了 14 倍。他们新推的 Meshy Creative Lab 能直接生成钥匙扣、冰箱贴、键帽这类小物件的 3D 模型,但正文没披露实物下单功能是否已上线。一个值得留意的数据是:他们测了 75 个模型,在拓竹切片软件里的切片通过率达到 97%,说明模型...

推荐理由:Meshy 这次更新不是画饼,是拿钱和打印通过率说话。我会先打个折:实物订购还没上线,正文只说“进入倒计时”,这点先别太激动。但 97% 的切片通过率对 3D 打印玩家是实打实的省事信号,说明模型不是只能看,真能打。ARR 年翻 14 倍也侧面印证头部厂商已经在买单,不是靠免费用户撑场面。整体是垂直 3D AI 产品的一次公司自曝数据更新,信息量够,但没到行业地震级别,放在 featured 低位合理。

机器之心 · 公众号

苹果新论文问:多模态模型没开口的 logits 里,到底藏了多少画面信息?

苹果这篇论文直接测了一个安全问题:视觉语言模型在生成回答前,内部那串“候选词概率”(logits)会不会把图片细节漏出去。他们在 CLEVR 和 MSCOCO 上做实验,发现只靠排名前 30 到 80 的 logits 值,就能反推出图片里有没有噪声、目标物体的特征,甚至部分背景属性。风险点在于,现在有些灰盒 API 会返回 top-k 的 log 概...

推荐理由:我会先打个折:这不是一个能直接拿来用的攻击工具,更像一次扎实的探针实验。但它的价值在于把“logits 能泄密”从直觉变成了可量化的证据,30–80 这个范围让风险变得具体。对做 VLM API 的团队来说,如果还在对外吐 top-k 对数概率,这篇论文值得立刻看一遍。

机器之心 · 公众号

Meshy 6 发布,这家靠 99 行代码复刻冰雪奇缘起家的公司,现在在欧美 3D AI 市场占了六成份额

Meshy AI 发了 Meshy 6,正文没披露具体技术细节。公司说自己在欧美发达市场占有率超过 60%,三年积累了 1000 万用户、年经常性收入超 4000 万美元,用 AI 生成了 1 亿多个 3D 模型。37 互娱用下来,基础雕刻工作量少了 30% 到 40%,说明工具确实能嵌进美术管线里省人力。不过文章因为环境异常没加载出完整内容,产品实际...

推荐理由:我会先打个折:欧美市场份额超60%是公司自己说的,正文没给第三方数据或基准测试,这点先别太激动。但 Meshy 6 的看点不在那个份额,而在三七互娱给出的30%到40%雕刻工作量减少,这是实打实的生产环节反馈。1000万用户和4000万美元 ARR 说明商业化跑起来了,对做 3D AI 工具的人有参考价值。整体信息量够,但缺独立验证,所以放在 featured 低段。

4月25日星期六

Hacker News 首页

Google 上线 Flow Music,用 Lyria 3 做歌、Veo 生成 MV

Google 悄悄上线了 Flow Music 网页版,目前有歌曲、歌单、空间、视频、项目和 Turntable 六个板块。核心功能是跟一个叫 Producer 的对话式工具聊天做歌,官方说它背后是 Lyria 3 模型,能生成带人声的完整歌曲;AI 音乐视频部分接的是 Veo 模型,可以自己控制角色和画面风格。页面还展示了一些示例曲目和可交互的迷你乐...

推荐理由:我会先打个折:正文没披露价格、地区、模型参数和版权机制,这些关键信息全缺,所以重要性停在 76 不动。但 Google 把 Lyria 3 和 Veo 打包成一个网页端音乐创作入口,6 类入口直接列出来,Producer 能出完整歌曲,这点对从业者来说信号很明确——大厂在认真推 AI 音乐工具,不是 demo。没写版权怎么处理,先别太激动,但上线本身已经够让做音乐 AI 的人盯着看了。

TechCrunch · AI

ComfyUI 拿了 3000 万美元,估值冲到 5 亿,卖点是让创作者自己搭 AI 生图/视频的工作流

TechCrunch 消息,ComfyUI 刚融了 3000 万美元,估值 5 亿。它的工具不是又一个模型,而是给创作者一个可视化节点界面,像搭乐高一样把 AI 生图、视频、音频的步骤串起来,精细控制出图效果。正文没披露投资方、融资轮次、具体定价和发布时间,所以这笔钱到底怎么花、商业化节奏如何,现在还不清楚。

推荐理由:TechCrunch 报了 3000 万融资和 5 亿估值,让可控媒体工作流从爱好者圈子变成正经市场信号。我会先打个折——投资方、轮次、定价、发布时间表正文都没披露,所以别急着对标大模型公司。真正值得盯的是它把控制权还给创作者,而不是又一家拼生成效果的模型厂。

Hacker News 首页

TIPSv2:Google DeepMind 给视觉语言模型换了套预训练配方,零样本分割涨了 14.1 分

Google DeepMind 发了 TIPSv2,一篇 CVPR 2026 论文,改了三处预训练方法,让视觉模型在零样本分割上明显变强。核心发现是:用蒸馏训练出来的小模型,在图像区域和文本的对齐能力上反而超过了大模型老师,原因在于老师模型在预训练时没管那些没被遮住的图像块。于是他们搞了个 iBOT++,把自监督学习的目标从只盯被遮住的块,扩展到所有图...

推荐理由:Google DeepMind 在 CVPR 2026 拿出的 TIPSv2,核心是三处预训练改动。最值得看的是 iBOT++:对遮挡和可见 patch 都加自蒸馏损失,零样本分割直接涨了 14.1 mIoU,同时用 Head-only EMA 把训练参数砍掉 42%。我会先打个折——这还是一次研究发布,不是当天就能用的模型,但可见 token 监督这个方向比堆大教师模型务实,对想省预训练成本的人是个信号。

The Verge · AI

一本新书复盘了 Maven 项目:美军是怎么从嫌弃 AI 到离不开它的

Katrina Manson 的新书梳理了 Maven 项目从 2017 年用计算机视觉分析无人机视频起步,到后来演变成 Maven Smart System 的全过程。书里最抓眼球的一个数字是:在对伊朗行动的头 24 小时里,美军靠这套 AI 系统辅助打了一千多个目标,规模差不多是二十年前伊拉克“震慑”行动的两倍。不过这篇采访没提现在用的是哪家公司的...

推荐理由:这篇讲的是美军怎么从 2017 年用 Project Maven 看无人机画面,走到今天靠 AI 系统加速生成打击目标。我会先打个折:正文没披露当前用的模型、供应商换过没有、部署范围多大,所以分数停在 74。但 24 小时打 1000 多个目标这个数字很直观,差不多是 20 多年前伊拉克“震慑行动”的近两倍,能让人立刻感受到 AI 在实战里的介入程度。Katrina Manson 的新书追溯了这段历史,不过细节缺口明显,这点先别太激动。

4月24日星期五

机器之心 · 公众号

复旦等团队提出 HERMES:把 KV 缓存当分层记忆用,流式视频理解首 token 延迟最高降 10 倍

这篇讲的是复旦大学、上海科学智能研究院和新加坡国立大学一起搞的 HERMES,一个不用重新训练就能加速流式视频理解的框架。核心思路是把模型里的 KV 缓存(你可以理解成模型在推理时记下的“草稿纸”)重新组织成三层记忆:当前帧的短期记忆、最近几帧的中期记忆,以及更早帧压缩后的长期记忆。同时它做了跨层记忆平滑和位置重编号,让模型读这段压缩历史时不会因为位置...

推荐理由:我会先打个折:这是学术研究,不是产品发布,所以重要性停在 82。但 HKR 三项都站得住——10 倍提速是实打实的标题钩子,68% token 削减和 27-29ms TTFT 是能拿来算账的数字,而且方案免训练、开源,对做流式视频落地的团队来说,省 token 就是省钱,低延迟就是体验。正文没披露长视频下的记忆退化情况和更多模型上的泛化结果,这点先别太激动,但现有数据已经够让做实时视频 agent 的人认真看一遍。

机器之心 · 公众号

机器人跑赢人类马拉松后,资本开始从硬件转向“大脑”

荣耀的人形机器人“闪电”在北京亦庄半马跑出50分26秒,比人类男子世界纪录57分20秒还快。宇树H1在1.9公里弯道赛段也跑出4分13秒。文章说2026年一季度具身智能融资近200笔、总额超300亿元,4月16日灵初智能又拿了4.55亿美元Pre-A轮。信号很直接:钱正从机器人本体流向模型和智能系统,硬件能卷的差不多到头了。

推荐理由:文章用一个直观的比赛成绩开场,然后落到融资数据和行业判断上,没有空谈概念。我会先打个折:正文没交代机器人是在什么规则、什么路况下跑的,和人类纪录的直接对比要谨慎看。但Q1融资规模和它石智航那笔大额Pre-A轮是实打实的新信息,加上“硬件护城河变浅、大脑才是下半场”这个判断,对关注具身智能方向的人有提醒作用。整体是评论性质,不是一手产品发布或论文,所以放在featured。

新智元 · 公众号

谷歌和何恺明团队搞了个 Vision Banana,想把所有视觉任务统一成“生成像素”这一种操作

Vision Banana 是谷歌 DeepMind 跟何恺明他们一起做的视觉模型,核心思路是用一套“像素生成”的界面去覆盖检测、分割、生成和编辑这些活,不再每种任务单独搞一个模型。文章里给了两组跟 Nano Banana Pro 的对比数据:在 GenAI-Bench 上人类偏好胜率 53.5%,在 ImgEdit 上胜率 47.8%,说明生成和编辑...

推荐理由:我会先打个折:训练数据规模和全量基准结果正文没披露,所以别急着对标完整模型。但真正值得盯的是接口变化——Google DeepMind 跟何恺明他们搞的这个 Vision Banana,把检测、分割、生成、编辑全统一成像素输出,不再往模型上挂一堆任务头。给的两组数字,GenAI-Bench 上对 Nano Banana Pro 人类评估胜率 53.5%,ImgEdit 上 47.8%,说明在生成和编辑任务上跟对手互有胜负,不是碾压。训练只提了混入少量可逆格式任务数据,具体配方没展开。对做多模态模型的团队来说,这个统一像素接口比具体分数更有嚼头,因为...

Hacker News 首页

GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos,而且人人都能用

安全公司 XBOW 用真实漏洞库测了 GPT-5.5,漏报率压到 10%,比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是,GPT-5.5 不看源码(黑盒)的效果已经超过了 GPT-5 看源码(白盒)的水平;一旦给它源码,性能直接拉爆,把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里,它登录成功的交互轮次只有...

推荐理由:我会先打个折:数据来自 XBOW 自家的漏洞基准,不是 OpenAI 官方发布,所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%,比 GPT-5 有源码时的 40% 低了一大截,也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%,登录目标系统需要的尝试次数直接砍半,说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力,这点先别太激动,正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说,这个信号足够盯紧了:模型在没看到源码的情况下已经能...

4月23日星期四

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

新智元 · 公众号

踏石智航拿了4.55亿美金Pre-A轮,红杉和高瓴一起领投

踏石智航在4月16号宣布完成4.55亿美元Pre-A轮融资,红杉中国、高瓴创投和美团联合领投。这笔钱创下了国内具身智能单轮和Pre-A轮融资的纪录。公司说他们的AWE3.0四模态模型把没见过视角的任务成功率提升了3倍,执行抖动降低了约45%,A1机器人还拿了个一小时完成亚毫米线束组装的吉尼斯纪录。不过正文没披露估值和具体交易条款,模型、数据和实际部署能...

推荐理由:这条我会先打个折,因为所有关键指标都是公司自己说的,正文没披露本轮估值和具体交割条件,外部验证也缺。但4.55亿美金这个数本身就够硬,红杉高瓴联手领投在具身智能里不常见,AWE3.0给的3倍成功率和45%抖动下降如果是真的挺省钱,A1那个吉尼斯纪录也说明在往工厂场景走。所以HKR三条都过,分数维持83,不升P1就是因为信息源单一,等第三方复现或估值细节出来再调。

Hacker News 首页

Flipbook:一个完全由图片模型实时生成的无限视觉浏览器

Flipbook 把整个网页变成一张张像素图片,你点击任何地方,它都会生成一张更深一层的新图片,没有 HTML、没有代码、没有文字图层。所有文字都是图片模型直接画出来的,所以偶尔会画歪或写错,这点随着模型变强会改善。内容来自智能体联网搜索和模型自己的知识,准确度大概跟用 ChatGPT、Gemini 这类对话产品查到的差不多。团队说他们做这个是因为现在...

推荐理由:我会先打个折:正文没披露延迟、成本、模型栈和实际用量,所以分数停在 76。但 Flipbook 这个实验值得盯,因为它把网站变成了一串实时生成的像素图,点击哪里就继续画哪里,连文字都是画出来的,不是叠上去的。信息来自 agentic 网页搜索加模型知识,交互机制比普通生成式 UI 激进得多。视频流功能目前还是高耗资源的实验开关,这点先别太激动。

4月22日星期三

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

Latent Space

OpenAI 发布 GPT-Image-2,图像生成模型开始能看懂文字、画 UI 和做排版了

OpenAI 正式推出了 GPT-Image-2,在 ChatGPT、Codex 和 API 里都能用。这次更新最明显的变化是文字渲染、排版和编辑能力大幅提升,能直接生成幻灯片、信息图、UI 稿和二维码,还支持多语言。模型分“思考”和“不思考”两个版本,思考版可以自己上网搜资料、生成多个候选图并自我检查。在 Arena 的图像排行榜上,GPT-Imag...

推荐理由:OpenAI 把 GPT-Image-2 同时铺到 ChatGPT、Codex 和 API,还特意强调 thinking 版本和文字渲染、布局编辑这些实用能力。Arena 上 Elo 1512、领先第二名 242 分,这个差距不小,说明在盲测里用户确实更愿意选它。我会先打个折——Arena 分数受采样和用户群影响,不能直接当绝对性能看,但三个第一同时拿下,至少说明在文生图这个赛道上它目前压了别人一头。对从业者来说,能不能稳定出可编辑、多语、带 QR 码的图,比单纯画质更重要,这条更新直接踩中了选型决策点。

X · @dotey(宝玉)

OpenAI 图片生成升级到 2.0,能听懂复杂指令、写对多国文字,所有 ChatGPT 和 Codex 用户都能用了

ChatGPT 的图片生成功能今天全面升级到 2.0,免费用户也能用。这次最大的改进是能处理复杂构图了,比如带文字的 UI 界面、密集排版,小字和图标渲染比之前靠谱很多。输出分辨率最高 2K,宽高比从 3:1 到 1:3 都支持,做横幅海报可以直接出图。多语言文字生成也有提升,OpenAI 说中文、日文、阿拉伯文这些非英文文本能写得语义连贯,不再乱码。...

推荐理由:这是一次有料的 OpenAI 产品更新:ChatGPT Images 2.0 同时铺到 ChatGPT、Codex 和 gpt-image-2 API,分辨率、宽高比、非英文文字稳定性都有具体数字,thinking 模式还加了联网搜索和自检。HKR 三项全中。不过原文是短摘要式转载,没写价格,也没说 thinking 模式什么时候给 Enterprise 用,这点先别太激动。

X · @OpenAI

OpenAI 发了 ChatGPT Images 2.0,说画图更准、能直接拿来用

OpenAI 在 X 上官宣了 ChatGPT Images 2.0,定位是能处理复杂视觉任务、出图直接可用的图像模型。帖子提到三点升级:编辑更精细、版式更丰富,以及加入了“思考级智能”,但没解释这具体指什么能力。视频演示看起来效果不错,不过正文没披露模型规模、定价、延迟和推送范围,我会先打个折——等看到实测和成本再说。

推荐理由:OpenAI 官方发的帖文,信源权威性没问题,加上“Images 2.0”这个名头,话题性和行业影响都够,所以 H 和 R 都给了。但我把分压在 featured 门槛附近,因为这条帖文信息量太薄:没模型细节、没定价、没延迟、没基准测试、也没说清楚谁现在能用,K 完全站不住。真正值得盯的是可编辑性和版式控制这两点,但光靠这条帖文还远不到能复现的程度,先打个折观望。

彭博科技

OpenAI 发了新版生图模型,专门强化了图表和科学示意图的生成能力

OpenAI 更新了它的图像生成软件,这次的重点不是画得更美,而是让模型能更准确地生成复杂图表和科学示意图。正文没披露模型名字、发布时间、定价、跑分数据或具体技术方案,目前能看到的信号是 OpenAI 在往专业场景里推,而不是继续卷通用画质。

推荐理由:OpenAI 这次更新瞄准的是图像生成里一个高价值但一直没做好的短板——图表和示意图的准确性。Bloomberg 的信源让这条消息有了基本可信度,所以 H 和 R 都给了通过。但摘要实在太短,模型叫什么、什么时候能用、收不收费、跑分多少、怎么实现的,一概没提,K 只能卡在不过。我会先打个折:方向对了,但落地细节为零,先别太激动。