跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 261–280 条 · 共 514 条

5月20日星期三

AI HOT 精选

Gemini Omni:谷歌新模型,先拿视频开刀,号称什么输入都能生成内容

谷歌发了条推文介绍 Gemini Omni,说这个模型能从任意输入生成内容,首发支持视频。正文没披露参数量、定价、上线时间,也没给任何跑分数据。我会先打个折:目前只有一段营销推文和一条线索串,实际能力、成本和延迟全都不清楚。

推荐理由:Google AI 发了一条 Gemini Omni 的预告帖,核心卖点是“从任意输入创造内容”,听着像是要把视频、音频、文本这些全揉进一个生成入口里。我会先打个折:正文没披露参数、没提定价、没给可用时间,也没贴任何基准测试结果,所以现在只能当概念验证看。如果是真的,对做多模态产品的团队来说挺省事,但没见到具体东西之前,这点先别太激动。

AI HOT 精选

谷歌发了 Gemini Omni,一个能把图文视频混着输入、直接出视频的多模态模型

谷歌在推上宣布了 Gemini Omni,说它能吃图像、视频和文本,吐出来的是基于 Gemini 现实世界知识生成的视频。目前只展示了视频生成这一个方向,正文没提模型大小、推理成本、能不能公开用、什么时候上线。我会先打个折:这更像一个预告,不是能立刻上手的东西。

推荐理由:谷歌扔了个 Gemini Omni,能拿图片、视频和文字一起喂进去,直接吐视频出来。我会先打个折:正文没披露模型多大、收不收费、什么时候能用,所以现在只能当个预告看。对跑视频管线的从业者来说,这个输入组合有点意思,但缺了价格和落地时间,暂时没法算账。

AI HOT 精选

Google I/O 发了几个 Gemini 新东西:新设计、智能体功能、Omni 和 3.5 Flash 模型

Google 在 I/O 大会上扔了一串 Gemini 更新。设计上用了“神经表达技术”,听起来像是让交互更自然,但正文没解释具体怎么实现。智能体功能提到了每日简报和 Gemini Spark,还没说什么时候能用。模型这边出了 Gemini Omni 和 3.5 Flash,参数规模、跑分、价格和发布时间一概没提,我会先打个折,等有实测再判断。

推荐理由:HKR 三项都成立:Google I/O 把 Gemini 的 Omni、3.5 Flash 和智能体打包发布,信息量够硬,也踩在开发者关心的竞品节奏上。我会先打个折——正文没给发布时间、参数和价格,所以重要性停在 84 分,featured 没问题。

r/LocalLLaMA

英伟达放出 Nemotron-Labs-Diffusion 模型,用扩散解码把 8B 模型跑到 850 tok/s

英伟达发了 Nemotron-Labs-Diffusion 系列,包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码,还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token,作为对比,同样条件下自回归解码是 253 tok...

推荐理由:NVIDIA 这次没走自回归老路,拿扩散模型做了三个稠密 LLM,最小的 3B,最大的 14B。我会先打个折:目前只有 Reddit 帖子当信源,没有论文或技术报告,所以 850 tok/s 这个数先别太激动,正文没披露具体测试条件和 batch size。但方向本身有意思——扩散并行解码加上 self-speculation,理论上可以一次出多个 token,不用像自回归那样一个字一个字往外蹦,推理延迟能压下去。8B 模型在 GB200 上跑出这个速度,如果属实,对本地跑模型、做实时对话的人挺省钱。信息缺口也明显:没提训练数据、没提多语言能力、没...

AI HOT 精选

谷歌搜索 25 年来最大改版:用 Gemini 3.5 Flash 把搜索框变成聊天框

谷歌在 I/O 大会上宣布搜索业务改版,核心是把搜索入口从“敲关键词”改成“直接说完整需求”。底层用新发布的 Gemini 3.5 Flash 模型跑响应,官方说速度是 GPT-5.5 的四倍,但没给具体延迟数据。AI Mode 上线一年后月活过了 10 亿,查询量每季度翻倍,说明用户确实在用。交互上,搜索框会动态变大,支持文字、图片、视频、文件甚至当...

推荐理由:谷歌搜索这次改版不是换个皮肤,而是把 AI 直接塞进搜索框和结果页,交互逻辑都变了。10 亿月活和每季度翻倍的查询量说明用户已经在用脚投票,不是实验室里的 demo。对做搜索、做内容、做 SEO 的人来说,这波改动会直接冲击流量分配和产品设计,所以优先级给到 p1。

The Verge · AI

Gemini 将接入沃尔沃 EX60 的外部摄像头,帮你读懂停车标志

Google 和沃尔沃在 I/O 大会上说,Gemini 会连上还没发布的 EX60 SUV 的外部摄像头,第一个功能是解释那些让人头疼的停车标志。这靠的是沃尔沃车机本来就用了 Google 的 Android Automotive 系统。Google 还提了一嘴,以后可能让 Gemini 回忆路过的路牌之类,但正文没展开说具体还有哪些场景。

推荐理由:H 和 K 都成立:Gemini 连上沃尔沃 EX60 外部摄像头做停车标志解读,是一个具体的多模态上车用例,不是画饼。R 偏弱,因为文章只说了功能存在,没讲怎么处理隐私、误判怎么兜底、会在哪些市场推送,这些信息缺口让冲击力打了折扣。

The Verge · AI

Google I/O 2026 一口气发了 13 个 AI 更新,Gemini 3.5 直接成了默认模型

Google 在 I/O 2026 上发布了新模型 Gemini 3.5 Flash,今天起它就是 Gemini 应用和搜索里 AI Mode 的默认模型了。更强的 Gemini 3.5 Pro 下个月才来。文章只提了这俩模型、搜索、Gmail 和智能眼镜 Project Aura 有更新,但没把 13 个发布全列出来,想看完整清单得去 The Ver...

推荐理由:这条消息有 I/O 大会的流量加持,Gemini 3.5 Flash 默认上线的动作也够快,对关注 Google 生态的人来说是个明确的信号。但正文只说了默认切换和 Pro 的时间点,13 项完整清单、跑分、定价这些关键信息都没给,所以重要性先打个折,放在 featured 里而不是直接上首页。

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,智商分涨到 55,速度超 280 tokens/秒,但运行成本贵了 5.5 倍

谷歌把 Gemini Flash 系列更新到了 3.5 版,智商评分从上一代的 46 分提到 55 分,直接超过了 Grok 4.3 和 Claude Sonnet 4.6。进步主要在两方面:一是让模型进业务流程干活(代理任务)更靠谱了,二是知识真实性提升,幻觉明显减少。输出速度超过每秒 280 个 token,在速度和智商之间卡了个好位置。多模态评测...

推荐理由:谷歌发Gemini 3.5 Flash,属于头部实验室的模型迭代,而且有Artificial Analysis的第三方数据撑腰,速度、智能、成本都摆出来了。HKR三项全中,尤其是5.5倍的成本跳涨让这条消息不止于常规发布,值得从业者看一眼。

TechCrunch · AI

Google 把街景塞进 Genie 世界模型,现在能直接生成可交互的街道模拟

Google DeepMind 把 Street View 街景数据接入了自家的世界模型 Project Genie,让它能根据真实街道照片生成可交互的 3D 场景。你可以像玩游戏一样在模拟街道里走动,还能调天气、看极端气候下的样子。官方说这会用在机器人训练、游戏和旅游场景里,但正文没披露模型参数、上线时间,也没给任何评测结果,所以实际效果和成本都还是...

推荐理由:谷歌 DeepMind 把 Street View 塞进 Project Genie,等于让街景从静态照片变成能走进去互动的模拟环境。我会先打个折:正文完全没披露模型大小、推理延迟、上线计划,也没给任何定量评测,所以现在只能当一次技术演示看。但它的钩子很实在——机器人训练可以直接用真实街景做仿真,游戏生成也能拿到现成的地图素材,再加上谷歌手里独一份的街景数据,这个方向本身值得关注。

TechCrunch · AI

OpenAI 给自家模型生成的图片加了两种防伪标记,查起来更方便了

OpenAI 宣布了两项措施来标记自家模型生成的图片。一是加入 C2PA 开放标准,在图片的元数据里直接写明“这是 AI 生成的”;二是把 Google 的 SynthID 水印技术集成到产品里,这是一种肉眼看不见的水印,想擦掉也没那么容易。这两招都只对 OpenAI 自家产品生成的图片生效,正文没提是否支持以前生成的老图,也没说具体什么时候上线。

推荐理由:我会先打个折:正文没写具体哪些产品上线、什么时候能用,也没说检测准确率或误判率,所以别当成熟方案看。OpenAI 这次做了两件事——一是加入 C2PA,相当于给图片贴上“数字出生证明”,记录谁、用什么工具生成的;二是在产品里塞进 Google 的 SynthID 水印,等于给图片打上肉眼看不见的标记,方便后续识别。有意思的是,OpenAI 没用自研方案,直接拿对手的技术来用,说明在图像溯源这块,行业更认开放标准而不是各搞各的。对从业者来说,这意味着以后做内容审核或平台合规,可能有一套更通用的检测路径,但前提是覆盖率和验证流程得跟上,这点先别太激动。

TechCrunch · AI

谷歌发布 Gemini Omni:用文字、图片和音频就能直接生成视频

谷歌推出了新的多模态模型 Gemini Omni,能把文字、图片、音频和视频作为输入,通过对话直接生成或编辑视频。首发版本叫 Omni Flash,主打跨模态推理,也就是模型能同时理解不同格式的信息并据此产出视频。但文章没公布具体上线时间、价格、上下文长度限制、跑分成绩,也没说 API 什么时候开放。这点先别太激动,目前看更像是一个技术预告,实际能用起...

推荐理由:Google 把 Gemini 的多模态能力推到了视频生成这一步,Omni Flash 能通过聊天界面把文字、图片、音频甚至视频片段变成新视频,还能编辑。这个更新在 HKR 三个维度上都站得住:玩法直观有传播力,产品形态和输入模态是明确的新信息,而且正好卡在多模态视频生成这个竞争激烈的节点上。正文没公布定价和具体上线时间,所以我会先打个折,把它放在必写但不算顶格的区间。

AI HOT 精选

谷歌发布 Gemini Omni 模型,任意输入都能生成任意输出,一句话就能改视频

谷歌在 I/O 2026 大会上推出了 Gemini Omni,这是 Gemini 家族目前能力最全的版本,能同时处理文字、图片、音频和视频,并直接生成这些格式的内容。现场演示了对话式视频编辑,用户说句话就能换掉视频里的角色或背景。先放出来的是速度更快的 Gemini Omni Flash,已经在 Gemini App、Google Flow 和 Yo...

推荐理由:谷歌在 I/O 上扔出 Gemini Omni 和 Omni Flash,主打全模态互转,一句话就能让 AI 改视频,听着挺猛。我会先打个折:API 什么时候开、怎么收费、跑分多少,正文全没提。Flash 已经进了自家三个产品,说明至少能跑起来,但外部开发者还得干等。这点先别太激动,等有定价和延迟数据再判断值不值得接。

AI HOT 精选

Gemini Omni 发布:先拿视频生成试水,目标是“什么都能生成”

Google DeepMind 发了条推,说 Gemini Omni 是他们朝“用任何内容生成任何内容”迈出的第一步,首发功能是视频生成。它把 Gemini 的理解能力和自家的生成式媒体系统揉在一起,号称在多模态理解和编辑上有大跨步。但正文没披露模型参数、价格和什么时候能用,我会先打个折——目前只有一句口号和一段视频演示,具体效果和限制还得等后续公开。

推荐理由:我会先打个折:正文没披露参数量、价格和开放时间,所以没法判断实际成本和可用性。但 HKR 三项都过关——DeepMind 用 Gemini 品牌推视频生成,切入点清楚,技术路线也说了(模型加生成系统),而且直接踩在视频生成的热门赛道上。信息缺口让分数停在 72–77 这个区间,不算高但合理。

AI HOT 精选

谷歌 I/O 大会公布数据:每月处理 Token 量超 3200 万亿,一年翻了 7 倍

谷歌 CEO 皮查伊在 2026 年 I/O 大会上甩出了一组数据:今年 5 月,谷歌平台每月处理的 Token 量超过 3200 万亿,比去年同期涨了 7 倍。这个数字说明谷歌 AI 服务的调用规模在急剧膨胀。同时,Gemini App 的月活用户超过了 9 亿,同比翻了一番多,每日请求量也涨了 7 倍多。另外,Nano Banana 这个模型已经累...

推荐理由:谷歌 I/O 这次放的是用量规模,不是新模型或重大能力发布。7 倍增长、9 亿月活和 3200 万亿 Token/月让 HKR 三项都过关,但因为没有产品级大更新,分数就落在 78–84 这个区间。我会先打个折:这些是平台方自己报的数字,外部没法独立验证,不过作为规模参考仍然有分量。

AI HOT 精选

NVIDIA 开源 LongLive 2.0,用 4-bit 量化把长视频生成跑进实时

NVIDIA 把 LongLive 2.0 整套训练和推理代码都放出来了,主打 FP4 量化加并行加速,在 50 亿参数的模型上能跑到每秒 45.7 帧,比很多短视频方案还快。它支持真实视频训练、蒸馏、多镜头生成、序列并行、KV 缓存优化和异步解码部署,专门解决以前长视频生成要么慢到没法用、要么只能做几秒片段的毛病。正文没披露具体显存占用和最长能生成多...

推荐理由:NVIDIA 研究员把 LongLive 2.0 完整开源了,不是只放个模型权重,而是给了训练加推理的全套工具。核心是把视频生成模型压到 4-bit 精度,在 50 亿参数规模下能跑到每秒 45.7 帧,这个速度意味着单卡就能玩长视频生成,不用堆机器。我会先打个折:论文里没看到跟 8-bit 或全精度方案的画质对比,所以省显存是实锤,画质掉多少还不清楚。但作为第一个把 4-bit 量化铺到长视频训练推理全流程的开源项目,对想低成本跑视频生成的人来说,值得立刻翻代码。

5月19日星期二

r/LocalLLaMA

字节跳动开源了一个 3B 参数模型,想用一个小体量搞定看图、看视频、生图和修图

字节跳动放出了一个叫 Lance 的开源模型,激活参数只有 3B,但试图把图像和视频的理解、生成、编辑都塞进一个模型里。帖子说它是从头训练的,用了分阶段的多任务训练配方,训练硬件是 128 张 A100 GPU。正文没披露训练时长、具体数据规模和各项任务的实测分数,所以实际效果和泛化能力还得等跑分和社区实测。

推荐理由:我会先打个折:正文没给任何 benchmark 分数,也没提许可证,所以实际能力还得等实测。但亮点很清楚——ByteDance 用 128 张 A100 从零训出一个 3B 活跃参数的多模态模型 Lance,图像视频的理解、生成、编辑全包了,还直接开源。这个参数规模和训练成本对想自己部署的团队诱惑很大,不过没看到对比数据前,先别太激动。

AI HOT 精选

OpenAI 给 AI 生图加了双重防伪:一层是信息标签,一层是隐形水印

OpenAI 公布了一套内容溯源方案,主要做三件事。第一,他们正式拿到了 C2PA 标准认证,以后用 DALL·E、Sora 等工具生成的图片都会自带一份可验证的“数字出生证明”,记录是谁做的、怎么改的。第二,他们和 Google DeepMind 合作,在 ChatGPT、Codex 和 API 生成的图片里嵌入了 SynthID 隐形水印。这层水印...

推荐理由:我会先打个折:正文没提覆盖哪些格式、上线范围多大、检测准确率多少,所以实际效果还得等。但这件事本身有信息量——OpenAI 没有单押一种溯源方案,而是把行业里两个主流标准(Content Credentials 做内容凭证,SynthID 做隐形水印)一起用,还给了验证工具。对开发者来说,这意味着以后接 OpenAI 模型出图、出视频,可以有一套现成的溯源管道,不用自己从零搭。这点先别太激动,因为没披露准确率,水印被裁切或压缩后还能不能认出来是未知数。但方向是对的,尤其对需要向用户或监管证明“这东西是 AI 生成的”的产品,省了不少事。

量子位 · 公众号

摩尔线程发布国产全栈具身智能仿真平台,机器狗“小飞”全程在自家 GPU 上完成训练

摩尔线程推出了 MT Lambda 仿真平台,把物理引擎、渲染和 AI 模型训练整合到一起,用自家的 GPU 跑通了从模拟到真机的完整流程。现场演示的机器狗“小飞”在仿真里学会走路后,直接迁移到实物上就能跑。不过正文因为需要验证码没能完整抓取,具体的技术参数、训练时长和成功率数据都没披露,这点先别太激动。

推荐理由:我会先打个折:性能、定价、开放方式和第三方验证正文都没给,所以重要性只能停在 featured 低位。但这条消息本身信息量够——摩尔线程拿出的是一个国产 GPU 驱动的具身仿真方案,不是纯软件缝合,而且用机器狗“小飞”做了 100% 仿真训练到真机迁移的 demo,说明链路至少跑通了。对国内做机器人、做仿真的人来说,这相当于多了一个可能绕开 NVIDIA 生态的选项,哪怕现在还很早期,也值得标记一下。

量子位 · 公众号

Odyssey 放出 Agora-1 世界模型,能四个人同时在线打 FPS,比李飞飞团队还快一步

Odyssey 发布了一个叫 Agora-1 的世界模型,主打实时生成可玩的 FPS 场景,最多支持四个真人或 AI 玩家在同一张图里对战。它把物理模拟和画面渲染拆开跑,训练数据用的是《黄金眼》游戏内部状态,不是单纯看视频学样子。正文没披露具体延迟和硬件成本,所以实际跑起来卡不卡、贵不贵还不清楚。我会先打个折:多人联机听着很酷,但没看到公开可测的版本,...

推荐理由:我会先打个折:Odyssey不是顶级基础模型厂商,所以分数压在78-84这个区间。但Agora-1确实把世界模型从单人看风景推到了4人联机打枪,仿真和渲染分开跑这个架构选择也值得留意。正文没披露延迟数据和画面一致性表现,这点先别太激动。训练数据用了GoldenEye的内部状态,说明他们走的是用游戏引擎内部信息喂模型的路子,不是纯视频学习,这跟其他家路线不一样。

纽约时报中文网

中国AI短剧每分钟成本200元,演员开始接不到戏了

一些中国公司现在不用摄像机、剧组和真人演员,就能以每分钟约30美元(200元人民币)的成本批量生产AI短剧。DataEye数据显示,仅今年3月就有近5万部AI短剧上传到抖音,几乎赶上该平台2025年全年总量。字节跳动2月发布的Seedance 2.0等工具让这类内容快速普及,但演员群体已经感受到冲击:32岁的横店演员李焦尔说近几个月角色“彻底消失了”,...

推荐理由:这篇不是产品发布或模型更新,但把 AI 短剧的成本和产量数字摆出来了:每分钟 30 美元,3 月抖音上传量接近去年全年。我会先打个折,因为正文没披露这些短剧的实际播放量和用户留存,光有上传量说明不了市场接受度。但选题本身把技术狂欢和失业焦虑绑在一起,对从业者来说比单纯讲模型能力更有嚼头。