跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 161–180 条 · 共 514 条

6月4日星期四

机器之心 · 公众号

谷歌放出 Gemma 4 12B,120 亿参数模型能在 16G 显存的笔记本上跑

谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...

推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。

量子位 · 公众号

CVPR 2026 上,小鹏给英伟达、特斯拉和 Waymo 讲了一遍自己的物理 AI 技术栈

小鹏在 CVPR 2026 上公开了他们的世界模型技术栈,包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算,相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练,这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒,对实时驾驶决策来说这个...

推荐理由:我会先打个折,这毕竟是小鹏在顶会上的技术展示,不是独立验证过的第三方评测,所以分数没给到 85 以上。但选题确实抓人:CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI,本身就制造了对比。信息量也够,X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟,都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例,也没说 80 毫秒是平均还是 P99,这点先别太激动。整体看,对做自动驾驶和端侧模型的人有参考价值,也踩中了中美技术竞争的神经,所以放在 featured 位置。

AI HOT 精选

Ideogram 4.0 开源,跑分自称全球最强,文字渲染和排版控制是亮点

Ideogram 发布了 4.0 版本,一个 93 亿参数的开源文生图模型。它把文字和图像信息放在同一条处理流水线上(单流 DiT 架构),并用了 Qwen3-VL-8B 当文本编码器。最突出的能力是能在图里准确写出长段文字,适合做海报和封面。另外,它训练时让模型理解了元素的位置关系,你用提示词就能指定版式和对象布局。在 DesignArena 的人工...

推荐理由:Ideogram 4.0把9.3B参数的文生图模型开源了,架构是单流DiT,在DesignArena人类偏好排名里拿了第4。我会先打个折——正文没披露训练数据规模和具体推理成本,所以实际部署的性价比还不好算。但一个开源模型能在人类评价里挤进前排,说明图像生成的质量门槛又在往下掉,对做应用的人来说是个省钱信号。

FT · 科技

英国议员起诉马斯克的 xAI,想用假色情图片案测试 AI 公司要不要为模型输出负责

英国工党议员 Jess Asato 把马斯克旗下 xAI 告了,起因是系统生成了她的虚假性相关图片。这案子被当成一个测试案例,核心是想搞清楚:AI 模型开发者到底要不要为模型吐出的内容承担法律责任。不过目前公开信息很少——正文没披露具体是哪个模型、图片是怎么生成的、索赔金额多少,也没说法庭排期。

推荐理由:我会先打个折:正文没披露具体是哪个模型、怎么生成的、索赔多少钱,所以信息有缺口。但这件事本身够硬——议员告 AI 公司,而且是在英国拿法律试水,直接问“模型产出谁担责”。FT 的报道把 xAI、马斯克、虚假性影像和法律责任测试绑在一起,话题性很强。因为缺技术细节和金额,分数压在 78–84 这个区间是合理的,不用往上拔。

Hacker News 首页

谷歌发布 Gemma 4 12B:一个去掉独立图像编码器的多模态模型

谷歌在官方博客宣布了 Gemma 4 12B,主打“统一、无编码器”的多模态设计。简单说,它不再像传统模型那样给图片单独配一个视觉编码器,而是让同一个模型直接处理文字和图像。博客里没给架构细节、训练数据、基准跑分、定价和开源协议,只提了一句“能在笔记本上跑高性能多模态智能”。这点先别太激动——12B 参数在笔记本上跑通常需要量化或剪枝,但正文没披露用了...

推荐理由:Google 发了 Gemma 4 12B,说它是统一的无编码器多模态模型,意思是不再单独接一个视觉编码器,结构上更省事。但这条消息目前只有标题和 HN 讨论热度,正文没披露参数量怎么分配、训练用了什么数据、推理成本降了多少,也没给任何跑分。我会先打个折,把它放在 80 分上下,因为钩子够强,但事实太少,不值得冲太高。

6月3日星期三

r/LocalLLaMA

谷歌放出 Gemma 4 系列,12B 模型能看图文、听音频,上下文窗口拉到 256K

谷歌 DeepMind 把 Gemma 4 系列的开源权重挂上了 Hugging Face,一共五个尺寸。其中 12B 这个版本支持文本、图片和音频三种输入,同时放出了指令微调版和预训练版。它原生支持系统提示词和函数调用,上下文窗口最长能到 256K token,意味着一次可以塞进很长的文档或对话记录。不过 Reddit 原帖被网络策略拦截,正文没披露...

推荐理由:Gemma 4 这次把开放权重、多模态和 256K 长上下文一起端上来,比常规版本更新更有看头。我会先打个折:正文没给具体 benchmark 和 license 细节,官方博客也没同步,所以判断先停在 83 分。如果是真的,12B 这个尺寸能跑图、能听音频,对本地玩家挺省钱。

MIT Technology Review · AI

特朗普签了新 AI 行政令,Anduril 和 Meta 在给美军做能“用眼神下命令”的 AR 眼镜

特朗普废掉旧令不到两周,又签了一份新的 AI 行政令。核心变化是:要求科技公司在发布前沿模型前 30 天,自愿把模型交给政府审查,但不设强制许可证。对比之前被搁置的版本(要求提前 90 天提交),这次明显缩水了,不过也算从完全不管迈向了轻度监管。另一条消息是,军工公司 Anduril 和 Meta 正在给美军搞一款 AR 头显原型,想实现用眼球追踪和语...

推荐理由:我会先打个折:行政令是“自愿”送审,不是强制,别当成立法看。但 30 天这个数字给了企业一个明确的时间窗口,比之前模糊的“提前沟通”要具体。另一条更硬——Anduril 和 Meta 的原型头显让士兵用眼动和语音指挥无人机打击,这已经不是实验室概念了。两条放一起,一条在收紧模型发布,一条在把 AI 往杀伤链里塞,反差够大,从业者得知道。

机器之心 · 公众号

蚂蚁灵波在 RSS 2026 提出首个自回归因果世界模型,用 50 条演示数据就能让机器人学会通用操控

蚂蚁灵波和港科大搞了个叫 LingBot-VA 的模型,把“预测画面接下来怎么变”和“判断该做什么动作”合到一个自回归框架里。论文说,每个任务只用 50 条真实世界的演示数据微调,在 RoboTwin 2.0 的简单和困难设定下,成功率分别到了 92.0% 和 91.1%。不过原文因为微信环境异常没抓到,具体实验细节和泛化边界暂时看不到,这个成功率数字...

推荐理由:标题的“50条数据”是个强钩子,对数据成本敏感的从业者吸引力很大。文章把自回归因果世界模型的机制讲得比较清楚,就是让模型先预测画面变化再决定动作,不是黑箱。但全文只有一篇论文发布,没看到开源代码、实物测试视频或跟主流基线(比如扩散策略)的量化对比,验证强度不够。所以重要性给78,属于值得关注但别急着全信的研究发布。

Latent Space

微软一口气发了7个新模型,MAI-Thinking-1是主打,还附了109页技术报告

微软在Build大会上发布了7个MAI系列模型,覆盖文本推理、代码、图像、语音转文字和语音合成。主角是MAI-Thinking-1,一个35B活跃参数的混合专家模型,支持256K上下文窗口。它被定位为微软首个推理模型,训练数据链条干净,没有用任何第三方模型做蒸馏。随模型一起公开的109页技术报告在圈内评价很高,因为透明度给得足。报告里写明,模型的推理能...

推荐理由:我会先打个折:微软这次没公开模型权重、定价,也没给第三方评测结果,所以没法验证它实际有多强。但光凭 7 个模型、35B 激活参数的 MoE、256K 上下文和 109 页技术报告这几个硬数字,信息密度已经够高。加上这事发生在 Build 大会,直接摆在微软自家模型和 OpenAI 依赖的交叉点上,话题性拉满。正文没披露具体 benchmark 分数,这点先别太激动,但作为当天新闻,重要性给到 87 是合理的。

量子位 · 公众号

大晓机器人和南洋理工搞了个统一物理3D生成框架,刚体、软体、带关节的物体都能一次搞定

这个框架叫PhysX-Omni,目标是让生成的3D模型直接能进物理仿真跑起来,不用再手动修。它把刚体、软体和关节体三类物体的生成统一到一个流程里,省掉了以前要分开处理的麻烦。配套的PhysXVerse数据集有8700个资产,覆盖2900个类别,规模不小。评测基准PhysX-Bench从几何、尺寸、材质、可交互性、运动学和文字描述六个维度打分,但正文没披...

推荐理由:统一物理 3D 生成这个钩子很清晰,数据集和评测基准的规模也给了实锤,对做机器人仿真的团队确实有用。不过正文没提开源、没提落地案例,也没说生成质量跟现有方案比到底好多少,所以分数先不打满,78 分合理。

AI HOT 精选

xAI 发布 Grok Imagine 1.5 预览版,一张静态图就能生成 720p 视频

xAI 在 API 里放出了 grok-imagine-video-1.5-preview 模型,能把单张静态图片变成一段动态视频。你给它一张起始帧,再用自然语言描述想要的镜头运动、节奏和音效,它就会按你的指令生成一段最高 720p 的短片。官方说模型会尽量保留原图的光影和细节,让视频像是原图的延续,而不是重新画了一遍。它也支持把多段生成视频串起来,拼...

推荐理由:xAI 放出了一个能用的图像转视频 API 预览版,720p 输出加上用自然语言调镜头和音效,功能点很实在。我会先打个折,因为这只是个预览版,不是完整的基础模型发布,所以重要性停在 82 分。

AI HOT 精选

Runway 把 Aleph 2.0 视频编辑放上 API,最长能改 30 秒 1080p 多镜头片段

Runway 的 Aleph 2.0 视频编辑功能现在可以通过 API 调用了,你可以把它直接嵌进自己的应用或产品里。它支持对最长 30 秒、1080p 的多镜头视频做局部修改,只动你想改的那部分,其他画面不变。正文没提价格、调用频率限制、处理延迟和地区可用性,这些实际落地要用的信息都还没给。

推荐理由:Runway 是视频生成的核心玩家,Aleph 2.0 把局部视频编辑能力开放成 API,上限拉到 30 秒和 1080p。这是个实用的产品更新,不是模型级大版本发布,重要性中等偏上。

r/LocalLLaMA

用 LiteRT 跑 Gemma 4 E4B,文字生成比 Q4 GGUF 快 2.4 倍,图片处理几乎没变

有人在 RTX 4060 Ti 16GB 上实测了 Gemma 4 E4B 模型。用 LiteRT 引擎跑文字生成,平均每秒能出 157.2 个 token,而用 llama.cpp 的 Q4 GGUF 格式只有 66.3 tok/s,快了大约 2.4 倍。不过图片标注任务就没这么乐观了:处理 111 张全分辨率图片,LiteRT 耗时约 72 秒,Q...

推荐理由:这是一篇个人在 Reddit 上发的实测,不是官方报告,权威性有限,所以分数没往上拉。但 H、K、R 三项都站得住:速度对比抓眼球,测试条件和数据都写清楚了,对想在自己机器上跑 Gemma 的人有直接参考价值。我会先打个折,因为只有单卡单次测试,没提功耗和精度变化,但作为一手体验已经够用。

The Verge · AI

微软在 Build 2026 上发了 Project Solara,一个给 AI 硬件跑智能体的安卓系统

微软在 Build 2026 大会上公布了 Project Solara,一个专门为跑 AI 智能体的硬件设计的操作系统。它底层是安卓,不是 Windows。现场展示了两个概念机:一个是类似 Echo Show 的桌面设备,用人脸识别解锁后可以直接调用各种 AI 智能体;另一个是可穿戴工牌,带摄像头和指纹扫描,能唤醒 AI 智能体。正文没披露具体上市时...

推荐理由:我会先打个折:正文没给发货时间、开发者接口和定价,所以别当产品发布看。亮点是微软在 Build 2026 上拿出的 Project Solara,一个跑在 Android 上的 AI 硬件系统,不是 Windows。现场有两台概念机,一台放桌上的带人脸识别,一台可佩戴的徽章带摄像头和指纹,说明微软在试探 agent 硬件长什么样。系统层面用 Android 意味着生态借力,但也绕开了自家系统,这点挺有意思。隐私那块正文没展开,只提了人脸和指纹,具体怎么处理数据没说。

6月2日星期二

AI HOT 精选

阶跃星辰放出 Step 3.7 Flash,开放权重,主打帮智能体写代码

阶跃星辰发了个新模型 Step 3.7 Flash,把权重开放了,你可以直接下载用。它的定位是给智能体编程场景用,强调工具调用可靠,还能处理多模态输入。同一天 MiniMax 也开源了 M3,两家模型都已经能在 Kilo 平台上跑。正文没披露具体的跑分、参数量或硬件门槛,所以实际快不快、省不省资源还得自己测。

推荐理由:这条消息的钩子在于“开放权重”和“智能体编程”两个点,不是常规发个新版本。我会先打个折:正文没给模型尺寸、跑分、许可证和定价,所以只能算有信息增量但缺关键验证。对开发者来说,能直接下载权重、能调工具、能看懂多模态输入,这几个能力放在一起确实有吸引力,尤其现在大家都在抢智能体编程这条赛道。Kilo 上线也让想试的人有个现成入口。不过没披露性能对比和实际成本,这点先别太激动,等后续数据出来再看值不值得切过去。

r/LocalLLaMA

NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型,能同时吃文字、图片、视频并生成视频、音频和动作指令

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face,这次发了两个尺寸:Nano 版 160 亿参数,Super 版 640 亿参数。它是个全模态世界模型,输入可以混着来——文字、图片、视频甚至动作轨迹都行,输出也不止视频,还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了,实际跑起来的硬件门槛...

推荐理由:我会先打个折:正文没披露 benchmark 分数、许可证和训练细节,所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上,这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说,输入支持动作轨迹、输出能直接给动作指令,说明它不只是生成漂亮画面,而是想往物理交互方向靠。这点先别太激动,因为没看到在真实机器人任务上的验证,但方向对,且开源降低了试错成本。

量子位 · 公众号

老黄带着英伟达 CPU 杀进 PC 赛道

英伟达要在今年秋天把一台叫 RTX Spark 的 Windows 电脑推向市场。这台机器把一块 Blackwell 架构的 RTX 显卡和一颗 20 核 Arm 架构的 Grace CPU 焊在一起,通过 NVLink-C2C 高速互联,共享 128GB 统一内存。官方给出的 AI 算力是 1 petaflop,号称能在本地跑起 1200 亿参数、上...

推荐理由:英伟达把RTX Spark搬进Windows PC,不是发新模型,而是给开发者一台能本地跑120B模型的机器。1 petaflop算力和128GB统一内存这些数字,说明它想解决本地跑大模型内存不够、上下文装不下的痛点。对从业者来说,这意味着可以省掉一部分云端推理成本,延迟也更可控。不过正文没提具体功耗和价格,实际性价比还得等上市再看。整体是硬件产品更新,不是基础模型发布,所以分数落在78到84之间。

Latent Space

英伟达连发三弹:Cosmos 3 世界模型、Nemotron 3 Ultra 大模型,还有一台叫 Spark 的个人超算

英伟达在台北电脑展上放出了一波开源模型和硬件。Cosmos 3 是一个能同时处理文字、图片、视频、音频和动作的“世界模型”,用了混合 Transformer 架构,把负责推理和负责生成的两个模块拼在一起。它分 Nano(16B)和 Super(64B)两个尺寸,其中 Super 微调后的文生图和图生视频能力,在开放权重模型里直接冲到了第一。Nemotr...

推荐理由:这次发布把视觉世界模型、大语言模型和本地推理硬件捆在一起推,信息密度高。Cosmos 3 的 MoT 架构和两个具体尺寸(16B/64B)给了明确的技术锚点,Nemotron 3 Ultra 的 550B-A55B 开放权重对想自己部署大模型的人是个实在消息。不过正文没给出具体 benchmark 对比或价格,实际效果和性价比还得等上手。整体影响面广,但还没到前沿实验室发新基础模型那种震动级别。

AI HOT 精选

NVIDIA Cosmos 3 在开放权重模型里拿了图像和视频生成双料第一

NVIDIA 的 Cosmos 3 在 Artificial Analysis 的开放权重榜单上,文本生图和图片转视频两项都排到了第一。它用了一种叫 Mixture-of-Transformers 的架构,把自回归推理器和扩散生成器拼在一起,有 16B 参数的 Nano 版和 64B 参数的 Super 版。Super 版在两项任务上分别超过了 HiD...

推荐理由:Cosmos 3 在 Artificial Analysis 的开放权重榜上把图像和视频生成的头名都拿了,我会先打个折——这只是单一基准的排名,不代表实际场景一定最强。但亮点在于它直接给了 16B 和 64B 两个尺寸,而且权重、代码、数据、微调方案全开源,这点对想自己训模型的人挺实在。正文没披露训练成本和推理延迟,所以别急着下“省钱”的结论。整体看,这条消息对关注开源多模态竞争的从业者有参考价值,放在 featured 档合适。

AI HOT 精选

Gemini Omni 能生成你的数字分身,放进视频里

Gemini App 发帖演示了用 Gemini Omni 捏一个长相和声音都像你的数字分身,然后直接塞进视频创作里。帖子没提这个功能什么时候上线、要不要付费,也没说怎么防止别人拿你的形象乱用。

推荐理由:我会先打个折:正文只说了 Gemini Omni 能做个人数字分身,没披露上线范围、价格、安全机制或授权流程,所以信息缺口不小。但官方账号自己放出这个功能点,说明产品方向已经定了,对做视频创作和虚拟人业务的人是个明确信号。HKR 三项都踩中:钩子够强,事实够新,风险够直接。因为细节太少,重要性只能给到 74,放在 featured 里当个产品更新提醒,别当成熟方案看。