跳到正文

#多模态

今日 1 条

5月21日星期四

The Verge · AI

YouTube Shorts 现在能用 AI 把别人的视频改成动画或给你换头

YouTube 给 Shorts 的“混剪”功能加了一个叫“重新想象”的选项,背后用的是 Gemini Omni 模型。你可以直接拿别人发过的短视频,让 AI 把画面风格改成动漫、替换画面里的东西,或者把自己的脸塞进原视频里。创作者可以在上传时决定允不允许别人用 AI 改动自己的内容。正文没提生成一次要多久、有没有水印,也没说免费用户能用几次。

推荐理由:Google 给 YouTube Shorts 的 Remix 加了个 reimagine 模式,用 Gemini Omni 直接改别人的短视频。我会先打个折:这不是新模型发布,是个产品功能更新,所以放在低 featured 档。但它的传播力很强,因为“混剪别人视频”这个动作本身就自带话题,而且创作者能选择关掉,这点在授权上算给了台阶。正文没披露这个功能什么时候全量上线,也没说对视频时长、分辨率的限制,这些缺口让实际影响还得再观察。

5月20日星期三

Hacker News 首页

字节跳动开源 Lance:一个模型同时搞定图片和视频的理解、生成与编辑

Lance 是字节跳动放出的一个多模态研究项目,把看图、看视频、生成图片、生成视频和编辑这些事塞进了同一个模型里。模型激活参数只有 3B,个头不大,训练用了不到 128 张 GPU,对想复现或微调的人来说门槛不算高。代码、论文和模型权重都公开了,但项目页没写具体的 benchmark 跑分和商用许可条款,这点先别太激动,得自己去翻论文和 HF 页面确认。

推荐理由:字节跳动的 Lance 把图像和视频的生成、理解塞进一个模型,激活参数 3B,训练用了不到 128 块 GPU。我会先打个折:正文没披露 benchmark 成绩、没放真实生成样本,授权协议也没说清楚,所以现在只能当研究发布看,别急着对标成熟产品。但单模型覆盖多模态这个方向,对想省部署成本的小团队确实有吸引力。

The Verge · AI

AI 内容打标签这事,到了见真章的时候

Google 在 I/O 大会上说,现在能更广地验证 SynthID 给 AI 图片打的水印了;另一边 C2PA 也在推一套叫 Content Credentials 的标准,想给图片、视频、音频都加上来源元数据。说白了,就是两套技术路线在比赛谁能更靠谱地告诉你“这东西是不是 AI 生成的”。但文章没具体说这次 SynthID 的验证范围到底铺到了多大...

推荐理由:这条消息本身有料,但正文没给出完整覆盖范围、落地时间表和实际采用数据,所以我会先打个折。它更像一次中量级的溯源更新,不是那种必须立刻写的重磅发布。

新智元 · 公众号

驭势科技在港交所上市,成为全场景L4自动驾驶第一股,市值超百亿港元

驭势科技今天在港交所挂牌,发行价每股60.30港元,公开发售部分超额认购6777倍。公司主要做机场、厂区这类封闭场景的L4级无人驾驶物流车和接驳车,2025年在大中华区机场L4商用车市场占了90.5%的份额。不过原文因为微信环境验证拦截,正文内容没抓到,具体的财务数据、技术路线和募资用途都没披露,这些关键信息得去翻招股书才能确认。

推荐理由:驭势科技港股上市,机场 L4 商用车市占率做到九成,公开发售被抢了六千多倍,说明市场对自动驾驶商业化这条路的买单意愿很强。不过正文没披露营收和盈利情况,光看市占率还判断不了生意本身赚不赚钱,这点先别太激动。

AI HOT 精选

Kling AI 上线原生 4K 视频生成,不再靠后期放大,直接出真 4K

Kling AI 在 4 月 23 日放出一个原生 4K 视频生成模型,不是先做低分辨率再放大,而是从生成阶段就按 4K 来跑。官方说好莱坞团队和 Wonder Studios 已经在用,制片人反馈这是他们工作流里第一个原生 4K 基础模型,Wonder Studios 特别提到原生生成能避免传统放大带来的角色变形,画面一致性更好。不过正文没披露价格、...

推荐理由:我会先打个折:这是厂商自己发的消息,不是第三方评测。能一键出原生4K确实少见,也报了合作方名字,所以给了featured。但没给任何可比的硬指标——生成一段4K要多久、花多少钱、最长能出多少秒,这些全没说。这点先别太激动,等实测出来再看。

机器之心 · 公众号

谷歌 I/O 大会后,搜索框直接变成了 AI 智能体入口

谷歌在 I/O 大会上发布了 Gemini 3.5 Flash,并把 AI 模式直接嵌进了搜索框。公司说现在它的 AI 服务每月要处理超过 3200 万亿个 token,已经有超过 850 万开发者在使用 Gemini。不过这篇文章因为微信平台的环境验证问题,正文内容没能加载出来,所以具体的模型参数、性能对比和实际体验细节都没法确认。

推荐理由:谷歌 I/O 这次把模型更新和搜索入口绑在一起推,AI Mode 直接嵌进搜索框,比普通功能发布重得多。Gemini 3.5 Flash 是新的轻量模型,月 token 消耗 3.2 千万亿说明用量已经很大,850 万开发者这个数字也够扎实。我会先打个折:正文没披露 3.5 Flash 的具体 benchmark 对比和定价,实际性价比还得等实测。但就凭搜索框变智能体这一条,当天必须写。

Latent Space

Google I/O 2026:Gemini 3.5 Flash 发布,百万 token 上下文、四种思考模式,主打编程和干活快

Google 在 I/O 大会上把 Gemini 重新定位成消费级 AI 入口和开发者代理平台。最核心的发布是 Gemini 3.5 Flash,今天就能用,上下文窗口 100 万 token,单次最多输出 6.5 万 token,提供“极简/低/中/高”四档思考深度,并且能在多轮对话里保留思考过程。官方说它比 3.1 Pro 更强,尤其在终端操作、编...

推荐理由:Google I/O 这次不是单点发布,是把模型、视频、agent 和开发工具打包一起推。Gemini 3.5 Flash 的定价和上下文窗口摆在那,对做应用的人有直接参考价值;Omni 的视频理解和 Spark 的后台 agent 思路,跟现在行业里追的 agent 落地、多模态成本是同一根神经。我会先打个折——现场 demo 和实际 API 稳定性之间通常有差距,但信息量够、时间点敏感,放 P1 没问题。

AI HOT 精选

通义千问发布 Qwen3.7-Max,主打长时间自主干活和跨平台编程

Qwen 团队推出了 Qwen3.7-Max,一个专为智能体场景设计的闭源模型。它最显眼的能力是能长时间自主执行任务,官方演示了一个连续跑 35 小时、调用上千次工具的内核优化任务。在编程方面,它在 Terminal Bench 2.0 上拿了 69.7 分,超过了 DeepSeek-V4-Pro Max 的 67.9 分;在 SWE-Pro 这类复杂...

推荐理由:Qwen Studio 发了 Qwen3.7,一口气覆盖聊天、图像视频理解、图像生成、文档处理、网页搜索、工具调用和工件生成,摆明要往智能体方向走。我会先打个折:正文没给任何 benchmark、定价、上下文窗口或延迟数据,所以没法判断实际可用性和成本。亮点是工具调用和工件生成这两项,说明模型不只是聊天,而是被设计成能进业务流程干活。这点先别太激动,等看到具体评测和接入方式再说。

AI HOT 精选

Gemini Omni 能拿你的脸和声音做数字分身,以后拍视频不用真人出镜了

Gemini Omni 上线了一个新功能,你可以用自己的长相和声音创建一个数字分身。建好之后,这个分身就能替你出镜生成视频,不用每次都重新上传照片。正文没提这个功能要不要钱、在哪些地区能用、什么时候正式上线,我会先打个折观望。

推荐理由:Gemini Omni 让用户拿自己的形象和声音做数字分身视频,建好之后不用反复传图,这点对做内容的人挺方便。但正文没写价格、哪些地区能用、什么时候上线,所以现在只能当个预告看。我会先打个折:功能听着省事,可落地时间表和成本都不清楚,别太激动。

AI HOT 精选

ChatGPT 图像生成周用量冲到 15 亿次,OpenAI 聊了聊 Images 2.0 带来的新玩法

OpenAI 发推说,现在大家每周在 ChatGPT 里生成超过 15 亿张图片。研究员 kenjihata、产品负责人 adele__li 和主持人 AndrewMayne 一起聊了 Images 2.0 上线后冒出来的新用法和趋势。正文没展开具体是哪些用例,也没给技术细节,就提了个数字和一场对谈。

推荐理由:我会先打个折:正文只给了 15 亿这个总数,没拆地区、模型版本或付费/免费比例,也没说 Images 2.0 具体改了啥。但光这个量级就够说明图像生成已经从尝鲜变成高频刚需,对算力规划和竞品压力都有参考价值。没有新能力或定价信息,所以分数停在 78 不往上拉。

AI HOT 精选

谷歌把 AI 概览和 AI 模式揉进一个搜索框,现在能传图、传文件、传视频问问题

谷歌上线了一个基于 Gemini 3.5 的新搜索框,把之前的 AI Overviews 和 AI Mode 合并成一个入口。你可以打字、传图片、丢文件或发视频,搜索会跨这些格式一起理解你的问题。支持多轮对话,回答会结合上下文更贴近你。桌面和手机端全球同步上线,正文没披露具体延迟和成本数据。

推荐理由:谷歌搜索这次更新,等于把 AI 对话直接嵌进了搜索框,支持文字、图片、文件、视频混着问,还能多轮追问。底层是 Gemini 3.5,把之前的 AI Overviews 和新的 AI Mode 整合在一起,桌面和移动端都上了。对做搜索、做内容、做 AI 产品的人来说,这意味着谷歌的流量分发逻辑在变,跟 Perplexity 那种 AI 搜索的竞争也更直接。不过原文信息偏薄,没写具体交互细节、覆盖地区有没有限制、实际回答质量怎么样,所以重要性我给 86,先别往 90 以上冲。

AI HOT 精选

Google 把 Tensor 芯片的 AI 能力开放给开发者,Pixel 10 手机上的 TPU 现在可以直接跑模型了

Google 发布了 Tensor ML SDK 的公开测试版,开发者现在能把 PyTorch 或 TFLite 模型转换、编译后,直接调用 Pixel 10 系列手机里的 TPU 芯片来跑推理。整个流程通过 LiteRT 这个统一框架完成,不用再分别对接底层硬件驱动。官方还提供了一个模型库,里面有超过 100 个现成的经典模型和生成式 AI 模型,包...

推荐理由:HKR-K 很扎实:文章给出了 Pixel 10 TPU 上的具体工作流和一个 100+ 模型库。H 和 R 也够得上 featured,但这是个测试版开发者 SDK,不是旗舰模型或面向大众的产品发布,所以我会先打个折。

AI HOT 精选

Gemini Omni 发布:能理解物理世界的视频生成模型,面向付费用户开放

Gemini Omni 不只是生成画面,它会判断场景里接下来该发生什么——比如物体掉落、碰撞这类物理规律,同时结合历史、科学和文化知识来构建内容。视频生成功能今天起向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放,可以在 Gemini 应用、Google Flow 和 YouTube Shorts 里用。正文没披露推理的具体技...

推荐理由:我会先打个折:正文只给了发布和接入渠道,没放任何物理推理的测试案例、视频生成的质量对比或具体定价,所以信息密度其实偏薄。但“物理推理+视频生成”这个标签本身够硬,加上直接打通 YouTube Shorts,对关注多模态生成和平台竞争的从业者来说是个明确的信号。基于现有信息,放在 85–94 这个区间偏低的位置是合理的,等有实测数据再往上调。

AI HOT 精选

Gemini Omni:谷歌新模型,先拿视频开刀,号称什么输入都能生成内容

谷歌发了条推文介绍 Gemini Omni,说这个模型能从任意输入生成内容,首发支持视频。正文没披露参数量、定价、上线时间,也没给任何跑分数据。我会先打个折:目前只有一段营销推文和一条线索串,实际能力、成本和延迟全都不清楚。

推荐理由:Google AI 发了一条 Gemini Omni 的预告帖,核心卖点是“从任意输入创造内容”,听着像是要把视频、音频、文本这些全揉进一个生成入口里。我会先打个折:正文没披露参数、没提定价、没给可用时间,也没贴任何基准测试结果,所以现在只能当概念验证看。如果是真的,对做多模态产品的团队来说挺省事,但没见到具体东西之前,这点先别太激动。

AI HOT 精选

谷歌发了 Gemini Omni,一个能把图文视频混着输入、直接出视频的多模态模型

谷歌在推上宣布了 Gemini Omni,说它能吃图像、视频和文本,吐出来的是基于 Gemini 现实世界知识生成的视频。目前只展示了视频生成这一个方向,正文没提模型大小、推理成本、能不能公开用、什么时候上线。我会先打个折:这更像一个预告,不是能立刻上手的东西。

推荐理由:谷歌扔了个 Gemini Omni,能拿图片、视频和文字一起喂进去,直接吐视频出来。我会先打个折:正文没披露模型多大、收不收费、什么时候能用,所以现在只能当个预告看。对跑视频管线的从业者来说,这个输入组合有点意思,但缺了价格和落地时间,暂时没法算账。

AI HOT 精选

Google I/O 发了几个 Gemini 新东西:新设计、智能体功能、Omni 和 3.5 Flash 模型

Google 在 I/O 大会上扔了一串 Gemini 更新。设计上用了“神经表达技术”,听起来像是让交互更自然,但正文没解释具体怎么实现。智能体功能提到了每日简报和 Gemini Spark,还没说什么时候能用。模型这边出了 Gemini Omni 和 3.5 Flash,参数规模、跑分、价格和发布时间一概没提,我会先打个折,等有实测再判断。

推荐理由:HKR 三项都成立:Google I/O 把 Gemini 的 Omni、3.5 Flash 和智能体打包发布,信息量够硬,也踩在开发者关心的竞品节奏上。我会先打个折——正文没给发布时间、参数和价格,所以重要性停在 84 分,featured 没问题。

r/LocalLLaMA

英伟达放出 Nemotron-Labs-Diffusion 模型,用扩散解码把 8B 模型跑到 850 tok/s

英伟达发了 Nemotron-Labs-Diffusion 系列,包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码,还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token,作为对比,同样条件下自回归解码是 253 tok...

推荐理由:NVIDIA 这次没走自回归老路,拿扩散模型做了三个稠密 LLM,最小的 3B,最大的 14B。我会先打个折:目前只有 Reddit 帖子当信源,没有论文或技术报告,所以 850 tok/s 这个数先别太激动,正文没披露具体测试条件和 batch size。但方向本身有意思——扩散并行解码加上 self-speculation,理论上可以一次出多个 token,不用像自回归那样一个字一个字往外蹦,推理延迟能压下去。8B 模型在 GB200 上跑出这个速度,如果属实,对本地跑模型、做实时对话的人挺省钱。信息缺口也明显:没提训练数据、没提多语言能力、没...

AI HOT 精选

谷歌搜索 25 年来最大改版:用 Gemini 3.5 Flash 把搜索框变成聊天框

谷歌在 I/O 大会上宣布搜索业务改版,核心是把搜索入口从“敲关键词”改成“直接说完整需求”。底层用新发布的 Gemini 3.5 Flash 模型跑响应,官方说速度是 GPT-5.5 的四倍,但没给具体延迟数据。AI Mode 上线一年后月活过了 10 亿,查询量每季度翻倍,说明用户确实在用。交互上,搜索框会动态变大,支持文字、图片、视频、文件甚至当...

推荐理由:谷歌搜索这次改版不是换个皮肤,而是把 AI 直接塞进搜索框和结果页,交互逻辑都变了。10 亿月活和每季度翻倍的查询量说明用户已经在用脚投票,不是实验室里的 demo。对做搜索、做内容、做 SEO 的人来说,这波改动会直接冲击流量分配和产品设计,所以优先级给到 p1。

The Verge · AI

Gemini 将接入沃尔沃 EX60 的外部摄像头,帮你读懂停车标志

Google 和沃尔沃在 I/O 大会上说,Gemini 会连上还没发布的 EX60 SUV 的外部摄像头,第一个功能是解释那些让人头疼的停车标志。这靠的是沃尔沃车机本来就用了 Google 的 Android Automotive 系统。Google 还提了一嘴,以后可能让 Gemini 回忆路过的路牌之类,但正文没展开说具体还有哪些场景。

推荐理由:H 和 K 都成立:Gemini 连上沃尔沃 EX60 外部摄像头做停车标志解读,是一个具体的多模态上车用例,不是画饼。R 偏弱,因为文章只说了功能存在,没讲怎么处理隐私、误判怎么兜底、会在哪些市场推送,这些信息缺口让冲击力打了折扣。

The Verge · AI

Google I/O 2026 一口气发了 13 个 AI 更新,Gemini 3.5 直接成了默认模型

Google 在 I/O 2026 上发布了新模型 Gemini 3.5 Flash,今天起它就是 Gemini 应用和搜索里 AI Mode 的默认模型了。更强的 Gemini 3.5 Pro 下个月才来。文章只提了这俩模型、搜索、Gmail 和智能眼镜 Project Aura 有更新,但没把 13 个发布全列出来,想看完整清单得去 The Ver...

推荐理由:这条消息有 I/O 大会的流量加持,Gemini 3.5 Flash 默认上线的动作也够快,对关注 Google 生态的人来说是个明确的信号。但正文只说了默认切换和 Pro 的时间点,13 项完整清单、跑分、定价这些关键信息都没给,所以重要性先打个折,放在 featured 里而不是直接上首页。

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,智商分涨到 55,速度超 280 tokens/秒,但运行成本贵了 5.5 倍

谷歌把 Gemini Flash 系列更新到了 3.5 版,智商评分从上一代的 46 分提到 55 分,直接超过了 Grok 4.3 和 Claude Sonnet 4.6。进步主要在两方面:一是让模型进业务流程干活(代理任务)更靠谱了,二是知识真实性提升,幻觉明显减少。输出速度超过每秒 280 个 token,在速度和智商之间卡了个好位置。多模态评测...

推荐理由:谷歌发Gemini 3.5 Flash,属于头部实验室的模型迭代,而且有Artificial Analysis的第三方数据撑腰,速度、智能、成本都摆出来了。HKR三项全中,尤其是5.5倍的成本跳涨让这条消息不止于常规发布,值得从业者看一眼。

TechCrunch · AI

Google 把街景塞进 Genie 世界模型,现在能直接生成可交互的街道模拟

Google DeepMind 把 Street View 街景数据接入了自家的世界模型 Project Genie,让它能根据真实街道照片生成可交互的 3D 场景。你可以像玩游戏一样在模拟街道里走动,还能调天气、看极端气候下的样子。官方说这会用在机器人训练、游戏和旅游场景里,但正文没披露模型参数、上线时间,也没给任何评测结果,所以实际效果和成本都还是...

推荐理由:谷歌 DeepMind 把 Street View 塞进 Project Genie,等于让街景从静态照片变成能走进去互动的模拟环境。我会先打个折:正文完全没披露模型大小、推理延迟、上线计划,也没给任何定量评测,所以现在只能当一次技术演示看。但它的钩子很实在——机器人训练可以直接用真实街景做仿真,游戏生成也能拿到现成的地图素材,再加上谷歌手里独一份的街景数据,这个方向本身值得关注。

TechCrunch · AI

OpenAI 给自家模型生成的图片加了两种防伪标记,查起来更方便了

OpenAI 宣布了两项措施来标记自家模型生成的图片。一是加入 C2PA 开放标准,在图片的元数据里直接写明“这是 AI 生成的”;二是把 Google 的 SynthID 水印技术集成到产品里,这是一种肉眼看不见的水印,想擦掉也没那么容易。这两招都只对 OpenAI 自家产品生成的图片生效,正文没提是否支持以前生成的老图,也没说具体什么时候上线。

推荐理由:我会先打个折:正文没写具体哪些产品上线、什么时候能用,也没说检测准确率或误判率,所以别当成熟方案看。OpenAI 这次做了两件事——一是加入 C2PA,相当于给图片贴上“数字出生证明”,记录谁、用什么工具生成的;二是在产品里塞进 Google 的 SynthID 水印,等于给图片打上肉眼看不见的标记,方便后续识别。有意思的是,OpenAI 没用自研方案,直接拿对手的技术来用,说明在图像溯源这块,行业更认开放标准而不是各搞各的。对从业者来说,这意味着以后做内容审核或平台合规,可能有一套更通用的检测路径,但前提是覆盖率和验证流程得跟上,这点先别太激动。

TechCrunch · AI

谷歌发布 Gemini Omni:用文字、图片和音频就能直接生成视频

谷歌推出了新的多模态模型 Gemini Omni,能把文字、图片、音频和视频作为输入,通过对话直接生成或编辑视频。首发版本叫 Omni Flash,主打跨模态推理,也就是模型能同时理解不同格式的信息并据此产出视频。但文章没公布具体上线时间、价格、上下文长度限制、跑分成绩,也没说 API 什么时候开放。这点先别太激动,目前看更像是一个技术预告,实际能用起...

推荐理由:Google 把 Gemini 的多模态能力推到了视频生成这一步,Omni Flash 能通过聊天界面把文字、图片、音频甚至视频片段变成新视频,还能编辑。这个更新在 HKR 三个维度上都站得住:玩法直观有传播力,产品形态和输入模态是明确的新信息,而且正好卡在多模态视频生成这个竞争激烈的节点上。正文没公布定价和具体上线时间,所以我会先打个折,把它放在必写但不算顶格的区间。

AI HOT 精选

谷歌发布 Gemini Omni 模型,任意输入都能生成任意输出,一句话就能改视频

谷歌在 I/O 2026 大会上推出了 Gemini Omni,这是 Gemini 家族目前能力最全的版本,能同时处理文字、图片、音频和视频,并直接生成这些格式的内容。现场演示了对话式视频编辑,用户说句话就能换掉视频里的角色或背景。先放出来的是速度更快的 Gemini Omni Flash,已经在 Gemini App、Google Flow 和 Yo...

推荐理由:谷歌在 I/O 上扔出 Gemini Omni 和 Omni Flash,主打全模态互转,一句话就能让 AI 改视频,听着挺猛。我会先打个折:API 什么时候开、怎么收费、跑分多少,正文全没提。Flash 已经进了自家三个产品,说明至少能跑起来,但外部开发者还得干等。这点先别太激动,等有定价和延迟数据再判断值不值得接。

AI HOT 精选

Gemini Omni 发布:先拿视频生成试水,目标是“什么都能生成”

Google DeepMind 发了条推,说 Gemini Omni 是他们朝“用任何内容生成任何内容”迈出的第一步,首发功能是视频生成。它把 Gemini 的理解能力和自家的生成式媒体系统揉在一起,号称在多模态理解和编辑上有大跨步。但正文没披露模型参数、价格和什么时候能用,我会先打个折——目前只有一句口号和一段视频演示,具体效果和限制还得等后续公开。

推荐理由:我会先打个折:正文没披露参数量、价格和开放时间,所以没法判断实际成本和可用性。但 HKR 三项都过关——DeepMind 用 Gemini 品牌推视频生成,切入点清楚,技术路线也说了(模型加生成系统),而且直接踩在视频生成的热门赛道上。信息缺口让分数停在 72–77 这个区间,不算高但合理。

AI HOT 精选

谷歌 I/O 大会公布数据:每月处理 Token 量超 3200 万亿,一年翻了 7 倍

谷歌 CEO 皮查伊在 2026 年 I/O 大会上甩出了一组数据:今年 5 月,谷歌平台每月处理的 Token 量超过 3200 万亿,比去年同期涨了 7 倍。这个数字说明谷歌 AI 服务的调用规模在急剧膨胀。同时,Gemini App 的月活用户超过了 9 亿,同比翻了一番多,每日请求量也涨了 7 倍多。另外,Nano Banana 这个模型已经累...

推荐理由:谷歌 I/O 这次放的是用量规模,不是新模型或重大能力发布。7 倍增长、9 亿月活和 3200 万亿 Token/月让 HKR 三项都过关,但因为没有产品级大更新,分数就落在 78–84 这个区间。我会先打个折:这些是平台方自己报的数字,外部没法独立验证,不过作为规模参考仍然有分量。

AI HOT 精选

NVIDIA 开源 LongLive 2.0,用 4-bit 量化把长视频生成跑进实时

NVIDIA 把 LongLive 2.0 整套训练和推理代码都放出来了,主打 FP4 量化加并行加速,在 50 亿参数的模型上能跑到每秒 45.7 帧,比很多短视频方案还快。它支持真实视频训练、蒸馏、多镜头生成、序列并行、KV 缓存优化和异步解码部署,专门解决以前长视频生成要么慢到没法用、要么只能做几秒片段的毛病。正文没披露具体显存占用和最长能生成多...

推荐理由:NVIDIA 研究员把 LongLive 2.0 完整开源了,不是只放个模型权重,而是给了训练加推理的全套工具。核心是把视频生成模型压到 4-bit 精度,在 50 亿参数规模下能跑到每秒 45.7 帧,这个速度意味着单卡就能玩长视频生成,不用堆机器。我会先打个折:论文里没看到跟 8-bit 或全精度方案的画质对比,所以省显存是实锤,画质掉多少还不清楚。但作为第一个把 4-bit 量化铺到长视频训练推理全流程的开源项目,对想低成本跑视频生成的人来说,值得立刻翻代码。

5月19日星期二

r/LocalLLaMA

字节跳动开源了一个 3B 参数模型,想用一个小体量搞定看图、看视频、生图和修图

字节跳动放出了一个叫 Lance 的开源模型,激活参数只有 3B,但试图把图像和视频的理解、生成、编辑都塞进一个模型里。帖子说它是从头训练的,用了分阶段的多任务训练配方,训练硬件是 128 张 A100 GPU。正文没披露训练时长、具体数据规模和各项任务的实测分数,所以实际效果和泛化能力还得等跑分和社区实测。

推荐理由:我会先打个折:正文没给任何 benchmark 分数,也没提许可证,所以实际能力还得等实测。但亮点很清楚——ByteDance 用 128 张 A100 从零训出一个 3B 活跃参数的多模态模型 Lance,图像视频的理解、生成、编辑全包了,还直接开源。这个参数规模和训练成本对想自己部署的团队诱惑很大,不过没看到对比数据前,先别太激动。

AI HOT 精选

OpenAI 给 AI 生图加了双重防伪:一层是信息标签,一层是隐形水印

OpenAI 公布了一套内容溯源方案,主要做三件事。第一,他们正式拿到了 C2PA 标准认证,以后用 DALL·E、Sora 等工具生成的图片都会自带一份可验证的“数字出生证明”,记录是谁做的、怎么改的。第二,他们和 Google DeepMind 合作,在 ChatGPT、Codex 和 API 生成的图片里嵌入了 SynthID 隐形水印。这层水印...

推荐理由:我会先打个折:正文没提覆盖哪些格式、上线范围多大、检测准确率多少,所以实际效果还得等。但这件事本身有信息量——OpenAI 没有单押一种溯源方案,而是把行业里两个主流标准(Content Credentials 做内容凭证,SynthID 做隐形水印)一起用,还给了验证工具。对开发者来说,这意味着以后接 OpenAI 模型出图、出视频,可以有一套现成的溯源管道,不用自己从零搭。这点先别太激动,因为没披露准确率,水印被裁切或压缩后还能不能认出来是未知数。但方向是对的,尤其对需要向用户或监管证明“这东西是 AI 生成的”的产品,省了不少事。

量子位 · 公众号

摩尔线程发布国产全栈具身智能仿真平台,机器狗“小飞”全程在自家 GPU 上完成训练

摩尔线程推出了 MT Lambda 仿真平台,把物理引擎、渲染和 AI 模型训练整合到一起,用自家的 GPU 跑通了从模拟到真机的完整流程。现场演示的机器狗“小飞”在仿真里学会走路后,直接迁移到实物上就能跑。不过正文因为需要验证码没能完整抓取,具体的技术参数、训练时长和成功率数据都没披露,这点先别太激动。

推荐理由:我会先打个折:性能、定价、开放方式和第三方验证正文都没给,所以重要性只能停在 featured 低位。但这条消息本身信息量够——摩尔线程拿出的是一个国产 GPU 驱动的具身仿真方案,不是纯软件缝合,而且用机器狗“小飞”做了 100% 仿真训练到真机迁移的 demo,说明链路至少跑通了。对国内做机器人、做仿真的人来说,这相当于多了一个可能绕开 NVIDIA 生态的选项,哪怕现在还很早期,也值得标记一下。

量子位 · 公众号

Odyssey 放出 Agora-1 世界模型,能四个人同时在线打 FPS,比李飞飞团队还快一步

Odyssey 发布了一个叫 Agora-1 的世界模型,主打实时生成可玩的 FPS 场景,最多支持四个真人或 AI 玩家在同一张图里对战。它把物理模拟和画面渲染拆开跑,训练数据用的是《黄金眼》游戏内部状态,不是单纯看视频学样子。正文没披露具体延迟和硬件成本,所以实际跑起来卡不卡、贵不贵还不清楚。我会先打个折:多人联机听着很酷,但没看到公开可测的版本,...

推荐理由:我会先打个折:Odyssey不是顶级基础模型厂商,所以分数压在78-84这个区间。但Agora-1确实把世界模型从单人看风景推到了4人联机打枪,仿真和渲染分开跑这个架构选择也值得留意。正文没披露延迟数据和画面一致性表现,这点先别太激动。训练数据用了GoldenEye的内部状态,说明他们走的是用游戏引擎内部信息喂模型的路子,不是纯视频学习,这跟其他家路线不一样。

纽约时报中文网

中国AI短剧每分钟成本200元,演员开始接不到戏了

一些中国公司现在不用摄像机、剧组和真人演员,就能以每分钟约30美元(200元人民币)的成本批量生产AI短剧。DataEye数据显示,仅今年3月就有近5万部AI短剧上传到抖音,几乎赶上该平台2025年全年总量。字节跳动2月发布的Seedance 2.0等工具让这类内容快速普及,但演员群体已经感受到冲击:32岁的横店演员李焦尔说近几个月角色“彻底消失了”,...

推荐理由:这篇不是产品发布或模型更新,但把 AI 短剧的成本和产量数字摆出来了:每分钟 30 美元,3 月抖音上传量接近去年全年。我会先打个折,因为正文没披露这些短剧的实际播放量和用户留存,光有上传量说明不了市场接受度。但选题本身把技术狂欢和失业焦虑绑在一起,对从业者来说比单纯讲模型能力更有嚼头。

AI HOT 精选

Qwen3.7预览版上线竞技场,阿里视觉排名冲到第五

阿里云在 X 上官宣 Qwen3.7-Plus-Preview 已经挂上竞技场,同时提到自家在视觉榜单上排到第五。帖子没给具体跑分、参评模型数量,也没说 Qwen3.7 系列什么时候正式发,只说“迫不及待要发布”。我会先打个折:排名第五听着不错,但不知道跟谁比、怎么比,这点先别太激动。

推荐理由:Qwen3.7-Plus-Preview 上了 Arena 并拿到视觉第五,我会先打个折——正文没披露具体分数、同期参评模型有多少、也没说什么时候正式发布。排名能说明模型在视觉任务上有竞争力,但信息缺口不小,分数暂时放在 featured 低位。

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

Latent Space

无人机自主技术栈与经济学:从宠物摄像头到 AI 制导炸弹

Yaroslav Azhnyuk 是 The Fourth Law 的创始人,这家公司做 AI 制导无人机。他之前创办了 Petcube,卖的是给宠物扔零食的摄像头,现在做的是给占领军扔炸药的摄像头。这期播客他和 Noah Smith 聊了两个小时,核心是 FPV 穿越机怎么成了战场上的新杀器——前线 70% 到 80% 的伤亡都是它造成的。他提出无人...

推荐理由:这是一期播客对谈,不是产品发布或论文,所以别当硬核技术报告看。我会先打个折:它给的是行业判断和框架,不是实测数据。但聊得挺实在,把无人机从遥控到全自主拆成了5个等级,又用8个维度讲战场怎么用、成本怎么算,还专门分析了中国制造为什么能把价格打下来。对想快速理解无人机产业和自主化路线的人,这期信息密度够,值得放进精选。

r/LocalLLaMA

Qwen 3.6 27B 在 24G 显存上的部署实测:后端、量化方案与参数对比

作者用一张 RTX 3090 24GB 跑 Qwen 3.6 27B,最终留用了 ik_llama.cpp 搭配 Qwen3.6-27B-MTP-IQ4_KS.gguf 这个量化版本。在 156k 上下文、q8_0 KV 缓存并开启 MTP 的设置下,输入约 5900 token 的提示、生成 1024 token 时,预填充速度约 1261 tok/...

推荐理由:这是一篇个人实测,不是官方发布,所以传播面窄一些,但信息密度很高。作者在单张 3090 上把 Qwen 3.6 27B 压进 24GB 显存,还跑通了 156k 上下文,最终选了 ik_llama.cpp 加 IQ4_KS 量化。prefill 能到 1261 tok/s,decode 72.9 tok/s,对本地部署来说相当可用。后端对比部分把 llama.cpp 系和 vllm 的取舍讲清楚了,对想自己搭推理服务的人有直接参考价值。我会先打个折:这只是单人单卡的一次测试,没有多卡、没有生产环境压测,但作为选型参考够用了。

AI HOT 精选

Grok 现在能直接看懂你上传的视频了

Grok 新增了视频理解功能,你可以把整个视频文件丢给它,让它实时分析画面、总结内容、做翻译、解释场景或提取关键上下文。它不只是看单张图片或读文字,而是能理解完整的视频。马斯克这条推文没提视频时长上限、支持哪些格式,也没说这个功能是全员推送还是灰度测试。

推荐理由:Grok 这次更新把视频理解加进来了,能上传整段视频做分析、总结、翻译和解释场景,对多模态产品来说是个实打实的进步。我会先打个折:正文没写支持多长的视频、什么格式、是不是全量上线,这些关键信息都缺着。所以虽然功能本身有看点,但只能按中等偏上的产品更新来处理,先别太激动。

AI HOT 精选

阿里云上线 HappyHorse 视频模型,一条提示词直接出 1080p 多镜头视频

HappyHorse 现在可以在阿里云 Model Studio 上用了。它主打从文字描述一步生成 1080p 的多镜头视频,官方说法是“电影级”画质。目前有个限时 8 折活动,但正文没写原价是多少、模型参数量多大、可用区域和有效期,也没给技术细节或对比评测。我会先打个折:效果到底怎么样,得自己跑几条片子才知道。

推荐理由:HKR 三项都过了:模型名字和 1080p 多镜头让标题有钩子,上线渠道、核心功能和折扣信息都给了,成本与竞争角度也踩中从业者关注点。但价格、参数量和评测都没披露,信息厚度一般,所以卡在 featured 门槛上。

Google DeepMind

Google DeepMind 发布 Gemini Omni Flash 视频生成模型

Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑。

推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。