跳到正文

#多模态

今日 1 条

5月29日星期五

r/LocalLLaMA

StepFun 3.7 Flash:196B 总参数、11B 激活的 MoE 模型,带 1.8B 视觉模块,能在 128GB 内存的本地机器上跑

StepFun 放出了 Step 3.7 Flash,一个混合专家(MoE)模型,总参数量 196B,但每次推理只激活 11B 参数,所以对算力要求没那么夸张。它内置了一个 1.8B 参数的视觉 Transformer(ViT),可以直接处理图像输入。官方说这个模型能在配备 128GB 内存的本地环境里运行,不用非得连云端。不过 Reddit 原帖被网...

推荐理由:StepFun 扔了个新模型,196B 参数但只激活 11B,还带了个 1.8B 的视觉模块,最抓眼球的是说能在 128GB 内存的机器上本地跑。我会先打个折:Reddit 上的信源比较散,授权协议、具体评测方法和能不能公开用都没说清楚,所以分数没给太高。但光凭这个规格和本地运行的承诺,对玩硬件和关注成本的人来说已经值得看一眼了。

AI HOT 精选

阶跃星辰开源 Step 3.7 Flash,198B 参数 MoE 模型,活跃参数约 11B,专为智能体工作流做效率优化

阶跃星辰放出了一个开源模型 Step 3.7 Flash,架构是 198B 参数的 MoE(混合专家),实际干活时只激活大约 11B 参数,所以跑起来相对轻量。上下文窗口给到 256K,能读图、读文档,也能直接生成代码或调用工具。它在 ClawEval-1.1 上拿了 67.1 分,SimpleVQA Search 上 79.2 分,这两个榜目前排第一...

推荐理由:这条发布的核心卖点是“大模型的身子,小模型的成本”,198B MoE 只激活 11B 参数,对想把模型塞进智能体流程的人吸引力很直接。256K 上下文和 ClawEval-1.1 的 67.1 分给了可查的硬数字,不是纯宣传。不过正文没提独立评测和实际延迟数据,这点先别太激动。整体信息量够、有记忆点,放在 featured 合适。

AI HOT 精选

Google 发布两款图像模型 Nano Banana Pro 和 Nano Banana 2,已接入 Gemini API 可用

Google AI 开发者账号官宣了两个图像模型:Nano Banana Pro(代号 gemini-3-pro-image)和 Nano Banana 2(代号 gemini-3.1-flash-image),现在就能通过 Gemini API 调用,直接上生产环境。帖子贴了一些社区示例展示效果,但正文没披露定价、跑分、并发限制这些关键信息,想评估成...

推荐理由:Google 这次一口气发了两个图像模型,Nano Banana Pro 和 Nano Banana 2,都走 Gemini API,直接面向生产环境。标题和摘要只给了名字和可用性,没提性能对比、价格、安全机制,所以没法判断实际强不强。我会先打个折,不往 p1 放,但作为产品动态值得让关注图像生成和多模态的人知道。

The Verge · AI

一部成本2000美元的AI电影将在翠贝卡电影节首映

翠贝卡电影节下月会首映一部75分钟的AI生成电影《Dreams of Violets》,讲的是伊朗政府大规模杀害抗议者的虚构故事,画面和人物全由AI生成。制作成本只花了2000美元,素材来自新闻报道、照片和目击者描述。电影由2019年离开伊朗的Koosha兄弟制作,哥哥Ash是制片公司Fountain 0的CEO,弟弟Pooya是联合创始人。正文没披露...

推荐理由:我会先打个折:这不是模型发布或平台更新,而是 AI 在电影制作上的一个应用案例,所以重要性给到 featured 的低段位。但 2000 美元拍出一部 75 分钟、能进翠贝卡的片子,这个数字本身就够抓眼球——它说明 AI 工具已经把长片制作的门槛拉到极低。文章没披露用了哪些具体模型、后期人工修了多少,这点先别太激动。不过,低成本加老牌影展的组合,对从业者来说,比单纯炫技更有冲击力,因为它直接摆出了“省钱”和“替代”这两个现实问题。

5月28日星期四

NVIDIA 博客

NVIDIA 在 ICRA 发了 8 篇论文,核心是让机器人在仿真里练完直接去现实世界干活

NVIDIA Research 在 ICRA 上展示了 8 篇论文,都围绕一个思路:在仿真里训练机器人,然后直接部署到真实环境。ScheduleStream 让多机械臂并行规划,速度提升 3 倍,代码已开源。COMPASS 导航框架完全不靠真实数据,在仿真里训练后迁移到真机,20 次真实导航测试成功率约 80%,比纯模仿学习基线高了 4.5 倍。Gra...

推荐理由:我会先打个折:这些成功率都是在论文设定的场景里跑出来的,换到更乱的现场不一定能复现。但 8 篇论文同时给出实机数据,而且不是零星的几次测试,ScheduleStream 的 3 倍提速和 COMPASS 的 20 次导航约 80% 成功,至少说明 sim-to-real 的 gap 在可控缩小。对正在纠结仿真训练能不能落地的团队,这组结果比纯讲架构有说服力。

r/LocalLLaMA

英伟达 LocateAnything:用并行框解码做视觉定位,号称比 Qwen3-VL 快 10 倍

英伟达放出了一个叫 LocateAnything-3B 的模型,专门做视觉语言定位——就是给张图、说句话,模型把对应物体用框标出来。它主打“并行框解码”,不像传统方法一个个框串行生成,所以速度上来了,标题直接写比 Qwen3-VL 快 10 倍。不过帖子正文只给了 Hugging Face、GitHub、Demo 和项目链接,没披露具体跑分设置和准确率...

推荐理由:我会先打个折:正文基本就是标题加三个链接,没有完整评测设置,也没给召回率、准确率这些质量指标,所以“快 10 倍”目前只能当官方说法看。但 Nvidia 开源一个 3B 的视觉定位模型,用并行框解码把速度拉起来,这件事本身对做实时视频分析、端侧部署的人挺实用。先放进 featured,等有第三方跑分再更新判断。

机器之心 · 公众号

ICML 2026:AutoMoT 用大小模型异步分工,在 Bench2Drive 和 nuScenes 上拿了双料第一

这篇文章本身被微信环境验证挡住了,正文内容没抓到,所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型,核心思路是把视觉语言模型和驾驶动作拆成两个专家:一个 4B 的 Qwen3-VL 负责看懂场景,一个 1.6B 的动作专家负责输出驾驶指令,而且两个模型是异步推理的,不用互相等。在...

推荐理由:我会先打个折:双 SOTA 听着唬人,但正文没披露 nuScenes 的具体指标,只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理,大模型负责想、小模型负责开,不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策,1.6B 的 AE 执行,这个组合在算力上挺省。不过论文没提实车验证,纯仿真成绩,这点先别太激动。整体看,对做自动驾驶算法的人有参考价值,但离出圈还差一口气,所以放在 featured 而不是更高一档。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。

AI HOT 精选

Hao AI Lab 开源 FastVideo Dreamverse,一张 B200 显卡 7 秒跑出 30 秒 1080p 视频

这个工具用一张 NVIDIA B200 GPU 搭配 LTX-2 模型,把生成 30 秒 1080p 视频的时间压到了 7 秒,做到了实时出片。代码和博客都公开了,但正文没披露画面质量、一致性和复杂场景下的表现,实际效果得自己跑一遍才知道。

推荐理由:我会先打个折:目前只有Hao AI Lab单方面放出的数据,没看到第三方跑分或横向对比,所以别急着当定论。但7秒出30秒1080p这个指标本身很直观,如果真能在单卡B200上稳定复现,对做实时视频生成的人来说省卡又省时间。正文没披露模型权重是否全开源、也没提长视频的连贯性测试,这两点会直接影响实际能用在哪。

5月27日星期三

AI HOT 精选

Runway 发布 MCP 服务器,让 Claude、ChatGPT 这类助手能直接在对话框里帮你生图和剪视频

Runway 推出了一个 MCP 服务器,相当于给 AI 助手装了个插件,让 Claude、ChatGPT、Cursor 等工具能在聊天窗口里直接调用 Runway 的模型生成图片和视频。你不用再切换软件,给助手扔一个商品链接、一张参考图或一段文字描述,它就能把成品返回到同一个对话框里。这次接入的模型包括 Gen-4.5、Seedance 2.0、GP...

推荐理由:这条消息的钩子很直接——Runway 的视频能力进了程序员和创作者天天用的对话工具。技术上不是模型突破,而是集成方式变了,MCP 服务器当中间人,让多个模型被一个入口调度。对从业者来说,这比单纯发个新模型更贴近实际工作流,所以 HKR 三项都成立。不过正文没提延迟、并发限制和计费方式,实际体验还得观望。整体算一次产品整合更新,重要性给 76 分,放在 featured 里合理。

TechCrunch · AI

YouTube 开始自动给 AI 视频打标签,不再全靠创作者自觉

YouTube 不再只靠创作者自己申报 AI 内容,现在会用内部系统自动检测并给“用了大量逼真 AI 画面”的视频打上标签。同时标签位置会更显眼,长视频和 Shorts 都适用。不过正文没披露这套自动检测的准确率、误判后怎么申诉、具体什么时候全面铺开,也没说对直播有没有用。

推荐理由:YouTube 不再只靠创作者自己勾选,而是平台主动识别并标注写实 AI 视频,标签也会更醒目。我会先打个折:正文没披露识别准确率、申诉机制和具体铺开范围,所以别急着把它当成完美方案。但这条更新本身是实打实的规则变化,对做视频生成和内容合规的人有直接参考价值。

量子位 · 公众号

7B小模型在医学影像理解上跑赢o3和GPT-5,靠的是教会模型“看哪里、怎么看”

上海创新研究院的LeapQuest和三所大学搞了两个医学AI系统Ophiuchus和MedScope,核心思路是让模型在看图看视频时学会像医生一样先定位关键区域再分析。Ophiuchus-7B在8个医学视觉问答基准上拿了68.0分,比OpenAI-o3的62.2、Gemini 2.5 Pro的61.8和GPT-5的59.9都高。正文没披露具体参数量以外...

推荐理由:我会先打个折:标题里 GPT-5 目前没公开评测数据,更像噱头,但 7B 模型在医学 VQA 上跑赢 o3 这个事实本身够抓人。正文给了 8 个 benchmark 的平均分对比,信息量撑得起 featured。不是通用大模型发布,分数定在 80 合理。

r/LocalLLaMA

PrismML 放出二值/三值 Bonsai Image 4B:1-bit 文生图扩散模型,浏览器里就能跑

PrismML 发布了 Bonsai Image 4B 的二值和三值版本,把文生图扩散 Transformer 的权重压到 1-bit 或三值,模型体积约 3GB。作为对比,FLUX.2 Klein 4B 大概要 16GB。Reddit 帖子里给了浏览器端 WebGPU 本地运行的 demo 链接,模型用 Apache-2.0 协议开源。不过帖子正文被...

推荐理由:PrismML 这个 Bonsai Image 4B 把文生图 DiT 压到 1-bit 和三值,模型约 3GB,能在浏览器 WebGPU 上完全本地跑,Apache-2.0 开源。我会先打个折:Reddit 信源、实验室发布,实际出图质量和速度还没第三方验证,这点先别太激动。但技术方向上,低比特量化做到浏览器可跑,对本地推理和隐私场景确实挺省钱,所以给 featured 低位。

5月26日星期二

AI HOT 精选

商汤把 SenseNova-U1 的训练代码全开源了,一个框架同时训生图、修图、交错生成和理解

OpenSenseNova 在 GitHub 上放出了 SenseNova-U1 的完整训练代码,用 Apache-2.0 协议。代码覆盖了 8B 稠密模型和 A3B MoE(混合专家)架构,在一个统一框架里支持四种多模态任务:文生图、图片编辑、图文交错生成,以及文本与视觉理解。工程上为大规模训练做了准备,支持混合并行、流式可恢复的数据管线、用环境变量...

推荐理由:这条消息的卖点是“完整训练代码开源”,不是常见的只放权重。8B 密集和 A3B MoE 两种模型规格都给了,Apache-2.0 协议也干净。不过正文没披露训练用了多少数据、多少算力,也没有任何评测结果,所以实际效果和训练成本现在没法判断。我会先打个折:代码开源本身值得关注,但别急着对标闭源模型,等社区跑出结果再说。

AI HOT 精选

Runway 发布 Project Luxo,用三部短片和一支广告证明 AI 视频已经跨过恐怖谷

Runway 放出了三部完全用 AI 生成的短片和一支广告样片,每部都由单人完成,制作时间从三周压缩到四小时。他们把这些片子拿给制片人、演员、工会成员和媒体看,得到的反馈是:观众不再盯着画面瑕疵,而是被故事本身抓住了。Runway 认为这意味着 AI 视频的视觉真实感、角色稳定性和创作可控性已经够用,技术开始退到幕后,故事走到了台前。不过正文没披露具体...

推荐理由:这是 Runway 的研究展示和样片发布,不是新模型或已上线的产品功能。给出的 4 小时出片数字很抓眼球,但正文没披露这个流程里人工修改了多少轮、失败率多高,所以我会先打个折。整体属于高质量展示,但离验证过的生产力工具还差一步。

阿里技术 · 公众号

南大和阿里发现 DiT 里的残差流拖慢收敛,改用跨层路由后训练快了近 9 倍

南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法,把 DiT 模型里固定的残差累积,换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试,FID 从 9.67 降到了 7.56,而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截,具体怎么实现路由、...

推荐理由:我会先打个折:这还是一个针对DiT架构的训练方法改进,不是新模型或产品发布,所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈,然后用一个时间感知的路由去替代固定累加,效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人,这个省钱省时间的信号够强,featured没问题。

量子位 · 公众号

浙大和阿里给生图模型加了个“先想再画”的模块,画数独、烧蜡烛这类精细活终于不翻车了

这篇论文提出了一个叫 Unified Thinker 的独立规划模块,专门解决生图模型一遇到需要精确空间推理的任务就乱来的问题。它不像以前那样让模型边想边画,而是把“思考”和“执行”拆开:先让模型生成结构化的推理步骤,再把这些步骤翻译成具体的视觉指令去生图。训练用了 4 万条叫 HieraReason-40K 的样本,分两阶段做强化学习,让模型学会在动...

推荐理由:这篇论文解决的是一个很实际的问题:多模态模型经常在需要一步步操作的视觉任务里翻车,比如画数独格子画错、烧蜡烛的步骤搞反。浙大和阿里的做法是给模型加一个独立的规划模块,用 4 万条专门构造的样本训练它先想清楚再下笔,再通过两阶段强化学习把思考过程转成可执行的视觉指令。正文没披露这个规划模块的具体参数量和推理延迟,所以实际部署成本还不好判断。但思路本身挺直接,如果规划模块够轻量,对提升视觉 agent 的可靠性会有帮助。

AI HOT 精选

Grok Build 测试版上线,SuperGrok 用户能直接用它做图、剪视频和跑自动化脚本

xAI 把 Grok Build 的测试版开放给了所有 SuperGrok 和 X Premium+ 用户。这次主要给了三个东西:Plan Mode 可以分步骤拆解任务;Imagine 模块能直接生成图片和视频;还有一个命令行工具(CLI),方便你把 Grok 接进自动化流程或者编排器里干活。想试的话去 x.ai/cli 就能开始。

推荐理由:HKR 三项都踩中了:xAI 放出一个付费测试版,功能名目列得清楚。分数卡在 featured 底线,因为正文没写能力边界、没给定价、也没测试数据,我会先打个折——东西看着热闹,但能跑多稳、花多少钱,现在还不知道。

5月25日星期一

r/LocalLLaMA

NuExtract3 发布:一个 4B 开源视觉模型,能把图片和文字转成 Markdown、做 OCR 和按模板抽信息,自己电脑就能跑

Numind 放出了 NuExtract3,一个基于 Qwen3.5-4B 的开源视觉语言模型,用 Apache-2.0 协议。它主要干三件事:把图片或文字转成 Markdown 格式、从图片里直接识别文字(OCR)、以及按你给的 JSON 模板把非结构化内容抽成结构化数据。模型只有 4B 参数,对硬件要求不高,官方说最低 4GB 显存就能在本地部署。...

推荐理由:NuExtract3 把一个 4B 大小的开源视觉模型打包成了文档抽取工具,支持 OCR、转 Markdown 和按你给的 JSON 模板把内容抽出来。最吸引人的是它最低只要 4GB 显存就能在自己机器上跑,这对在意数据不出本地的团队来说省了不少事。模型基于 Qwen3.5-4B,用 Apache-2.0 协议,没有授权上的坑。不过正文没给出具体的抽取准确率或延迟数据,实际效果得自己测一下才知道。

机器之心 · 公众号

众趣科技开源浏览器端3D高斯泼溅查看器,10亿个高斯点也能跑,内存和速度都比李飞飞团队的Spark 2.0强

众趣科技把他们的Aholo Viewer开源了,这是一个在浏览器里直接看3D高斯泼溅场景的工具。在300万个高斯点的测试里,它占用的内存只有Spark 2.0的一半,加载速度快了一倍,渲染速度快了两倍,而且宣称能撑住10亿个高斯点的场景。不过正文因为环境验证没抓到具体技术细节,我会先打个折:实际效果得自己跑一下才知道,但光看这几个数字,在网页端做大规模...

推荐理由:这条消息我会打个80分。群核科技这次开源的不是基础模型,而是一个3D渲染工具,但“10亿高斯点塞进浏览器”这个钩子很直观,性能对比也给了具体数字,不是空口说快。对从业者来说,浏览器端能跑这种量级的场景,部署上确实省事省钱。不过正文没披露10亿点场景的具体交互帧率,这点先别太激动,等他们后续补数据。

5月24日星期日

机器之心 · 公众号

ICML 2026 中了一篇让视觉模型学会“多条思路并行思考”的论文,但正文被验证页挡住了

这篇被 ICML 2026 接收的论文叫 Visual Para-Thinker,给视觉语言模型加了一套并行思考框架。核心是用 Pa-Attention 和 LPRoPE 把视觉推理拆成四条独立路径,让模型同时从不同角度理解图像,再综合出答案。训练数据是 16.3 万组问答对,规模不算大,所以泛化能力得打个问号。不过目前文章页面被微信环境异常验证挡住了...

推荐理由:这篇 ICML 2026 论文给视觉语言模型装了一个并行思考框架,叫 Visual Para-Thinker。核心是把视觉推理拆成 4 条路径同时跑,用 Pa-Attention 和 LPRoPE 做隔离,防止路径间串味。训练数据是 16.3 万对问答,规模不算大,但够验证想法。我会先打个折:这是单篇研究,没有多团队复现或产品落地,所以重要性停在 79。对做多模态推理加速和内部机制拆解的人,这篇值得看,但别当成熟方案直接用。

新智元 · 公众号

Anthropic 三张底牌全翻:Mythos 1 首次现身,Opus 4.8 被扒出

Anthropic 的新模型和项目被提前曝光了。claude-opus-4.8 的名字出现在 Google Vertex AI 平台上,同时一份 59.8MB 的 Claude Code 源码映射文件泄露,里面 51.2 万行 TypeScript 代码不仅提到了 Sonnet 4.8,还带出了 Mythos 1 的线索。Mythos 1 看起来和 C...

推荐理由:我会先打个折:这是泄露加平台列表,不是 Anthropic 官方发布。正文没披露能力分数、定价、上下文窗口或可复现评测,所以分数卡在 78–84 区间。但 Mythos 1 第一次被挖出来,Opus 4.8 又在 Vertex 上露脸,对关注 Anthropic 路线图的人来说信息量不小,值得放进 featured。

r/LocalLLaMA

视觉模型直接读 PDF vs 先 OCR 再问答:一次长文档实测

作者用 Claude Sonnet 4.5 跑了 MMLongBench-Doc 里的 30 份带图、带表格的 PDF,共 171 道题,对比两种路线:让模型直接看 PDF 画面,和先用 OCR 把文档转成文字再喂给模型。直接看 PDF 的准确率只有 52.0%,在六套方案里排第五,每次查询成本 0.2552 美元。表现最好的是 LlamaCloud ...

推荐理由:作者拿 Claude Sonnet 4.5 直接读 PDF 图片,在 MMLongBench-Doc 上跑出 52.0% 准确率,每题烧掉 0.2552 美元,比 LlamaCloud 的 OCR 管线低了 7.6 个百分点。样本只有 30 份文档、171 道题,结论别急着推广,但至少说明现在原生视觉模型处理带图表的长文档还不稳,而且贵。正文没披露具体文档类型分布和问题难度,这点先打个折。

5月23日星期六

机器之心 · 公众号

FlashAR 用 0.05% 的训练数据,把自回归图像模型的生成速度提了 22.9 倍

浙大和阿德莱德大学搞了个 FlashAR,专门给预训练好的自回归图像模型加速。拿 Emu3.5-Image-34B 试了一下,生成一张 512×512 的图,原来要 130.10 秒,现在只要 5.68 秒,快了 22.9 倍。而且只用了原始训练数据量的 0.05% 做微调,GenEval 分数从 80.48 变成 80.29,画质基本没掉。正文没披露...

推荐理由:FlashAR 用极少量数据给预训练好的自回归图像模型做加速,速度提升 22.9 倍,质量几乎没掉,对在意推理延迟和成本的团队是个好消息。论文给了具体数字和 GenEval 对比,信息量够,但正文没披露这 0.05% 数据具体怎么选、不同分辨率下是否同样有效,这点先别太激动。整体是扎实的推理优化工作,不是顶级实验室的模型发布,放 featured 合适。

The Verge · AI

上手 Gemini Omni:什么都能转什么都能生,我先拿毛绒玩具试了试

作者去年用 Gemini 给儿子的毛绒鹿做过一段度假视频,没给孩子看,但这件事让他反复琢磨“无害的 AI 乐子”和“纯 AI 垃圾”之间的那条线。这次上手 Gemini 的“任意输入、任意输出”新模型,他再次拿那只毛绒鹿做了一段 deepfake 视频,发现生成逼真视频的工具已经好用到几乎不需要技术门槛,而且这个趋势还在加速。正文没披露模型参数量、定价...

推荐理由:这篇值得推,因为 The Verge 上手玩了一个很唬人的 Gemini 新模型,用一张毛绒鹿照片直接生成视频,效果够“野”。但我会先打个折:全文就一个例子,没参数没价格没时间表,属于尝鲜体验不是产品发布。H 和 R 都过关,K 卡在信息太少,所以整体给 featured 但别当硬核技术稿看。

r/LocalLLaMA

美团 LongCat 放出视频数字人模型 1.5 版,换用 Whisper 做语音驱动,推理步数压到 8 步

美团 LongCat 在 Hugging Face 上发了 LongCat-Video-Avatar-1.5,模型权重用 MIT 协议开源。它能做音频驱动视频、音频加图片驱动视频,还能接着一段视频往后生成。这版把语音编码器从 Wav2Vec2 换成了 Whisper-Large,理论上对语音的理解会更准。推理部分用 DMD2 蒸馏把步数降到了 8 NF...

推荐理由:我会先打个折:这不算行业地震级别的发布,但对做开源视频数字人的团队来说是个实在的更新。H、K、R 三条都站得住——美团 LongCat 把模型权重用 MIT 协议放出来,推理压到 8 NFE,意味着本地跑起来的门槛低了不少。技术上,它把语音编码器从 Wav2Vec2 换成 Whisper-Large,对中文语音的适配可能会更好,但正文没给出具体的对比测试数据,这点先别太激动。如果是真的省钱又好用,对想自己搭数字人、不想走云端 API 的开发者来说,是个值得上手试试的选项。

AI HOT 精选

Gemini 月活破 9 亿,新增两个能替你干活的代理功能

Google 说 Gemini 应用月活用户超过 9 亿了。这次更新把 Gemini 从问答工具往主动干活的个人代理方向推了一步。新模型叫 Gemini 3.5 Flash,还换了套叫“Neural Expressive”的设计语言,另外 Gemini Omni 模型能把提示词直接生成视频。重点在两项代理功能:Daily Brief 会给你出个性化每日...

推荐理由:Google 这次更新核心就两件事:一是 Gemini 应用月活冲到 9 亿,盘子确实大;二是推出了 Daily Brief 和 Gemini Spark 两个代理功能,后者可以在用户授权下 24 小时跑任务。我会先打个折,正文没披露代理功能的具体完成率和延迟数据,实际干活靠不靠谱还不知道。但 9 亿这个量级加上“常驻后台的个人代理”定位,对做 agent 产品的团队来说是个明确的信号——大厂开始用自家分发渠道推代理了,竞争门槛在抬高。

5月22日星期五

TechCrunch · AI

Google 的 AI 眼镜我们上手试了,离好用就差一口气

Google 在 I/O 大会上给了一小段上手时间,试的是带显示功能的 Android XR 眼镜,不是今年秋天只出声的那款。镜片上能直接叠一层信息,比如天气、步行导航、打车详情和实时翻译,还能用 AI 自己捏小组件。眼镜会同时支持 iPhone 和安卓手机。但正文没提价格、什么时候开卖、续航和具体硬件参数,所以现在只能算工程机阶段,别急着掏钱。

推荐理由:我会先打个折:正文没披露价格、上市时间和续航,所以重要性停在 74 分、放在 featured 低位是合理的。但 TechCrunch 的实际上手测试本身就比通稿有说服力,Gemini 把翻译和导航叠进视野这个机制,是把 AI 从“问一句答一句”推到“你看着世界它帮你理解”的关键一步。对从业者来说,这比又一个聊天机器人更新更值得盯。

AI HOT 精选

Project Genie 接入谷歌街景,能把美国真实地点变成可交互世界

Project Genie 和谷歌地图街景打通了,现在你可以把美国真实地点直接转成能走进去玩的交互式世界。正文没披露具体支持哪些城市、生成机制、收费方式,也没说开放范围有多大。

推荐理由:Project Genie 跟谷歌街景合作,把美国真实地点变成能走进去互动的世界。我会先打个折——正文没写具体城市、生成机制和开放范围,所以别当产品发布看。但如果是真的,用街景数据直接生成可交互环境,省掉建模成本,这点对做仿真和世界模型的人挺有吸引力。

AI HOT 精选

网易有道把“子曰4”的多模态模型和语音合成模型都开源了

这次开源的是一个270亿参数的多模态模型和一个语音合成模型。多模态模型主要针对教育场景,能看懂带图表的数学题,在纯中文数理难题上准确率81.4%。团队用精简过的推理样本做训练,把模型思考过程的输出长度压缩了43.2%,所以回答同样的问题,吐出的token更少、推理更快,直接效果就是推理成本会降下来。语音合成模型支持用3秒中文音频克隆音色,能跨14种语言...

推荐理由:我会先打个折:有道不是前沿大模型实验室,所以这条消息的份量到不了顶流,但信息本身够具体。27B 参数的多模态模型,中文数理题做到 81.4% 准确率,说明在中文理科场景有一定可用性,不过正文没披露评测集和对比基线,这点先别太激动。语音模型覆盖 14 种语言,对做多语言 TTS 产品的人是个直接可用的资源。全量开源意味着可以直接拿来微调或部署,省去从头训的成本,但实际推理开销和显存需求正文没提,动手前得自己测一下。整体看,这是一次信息完整、可验证的发布,对关注中文多模态和语音落地的从业者有实操参考价值。

Hacker News 首页

宾州一所高中被 AI 换脸裸照撕裂

404 Media 报道,宾州拉德诺高中一名高一男生花了 250 美元订阅 App Store 里的 Movely 应用,把五名女同学的脸贴到裸体上,生成了 AI 儿童性虐待材料。事情发生在 2025 年 12 月,男生事后用学校发的设备在 Snapchat 上跟朋友说“每一分钱都花得值”,第二天他没去上学,但女生们去了,还发现男生们在替他打掩护。文章...

推荐理由:404 Media 挖出的这个案子很具体:Radnor 高中 5 名女生被同学用 AI 生成假裸照,涉事新生承认花 250 美元买了 Movely 订阅。正文没提警方后续怎么处理,也没说学校有没有启动调查,这点信息是缺的。但光凭受害者全是未成年人、工具成本明确这两条,就足够让关注 AI 安全的人绷紧神经——这不是模型跑分翻车,是真实世界里已经发生的伤害。

机器之心 · 公众号

CVPR 2026 | HiF-VLA:用视频压缩的思路教机器人“边看动作边想下一步”

西湖大学团队搞了个叫 HiF-VLA 的框架,核心想法是把机器人看世界的方式从“一帧帧静态图”换成“画面怎么动的”。它直接用 H.264 这类视频编码器从画面里提取紧凑的运动向量,再让一个联合专家模型同时预测未来的视觉动态和该做的动作序列。论文里给的数据是,在设定的历史窗口下,显存峰值 31.4GB,延迟 117.7 毫秒。不过正文因为环境验证问题没加...

推荐理由:这篇 HiF-VLA 我会先打个折:它还是一个单篇研究,没有落地案例或多方交叉验证,所以放在 featured 低位。但它的思路确实比多数 VLA 论文更“省”——直接用 H.264 运动向量代替逐帧视觉编码,把“看变化”和“想动作”塞进联合专家里一起算,显存压到 31.4GB、延迟 117.7ms,对想在真机上跑实时推理的团队是个可参考的方向。正文没披露在真实机械臂上的成功率或与主流 VLA 的 head-to-head 对比,这点先别太激动。

机器之心 · 公众号

Meta 华人团队发布 ATLAS:用一个词让视觉模型学会可泛化的推理

Meta AI 和港中文的研究者搞了个叫 ATLAS 的方法,核心是在视觉语言模型里塞一个“功能词”(Functional Token),让模型能同时走两条路:一条是显式的、一步步调用工具去操作图像(Agentic 推理),另一条是隐式的、在内部潜空间里直接算(Latent 推理)。他们配套搞了个 ATLAS-178K 数据集,分两阶段训练——先做监督...

推荐理由:我会先打个折:这是 Meta AI 和港中文联合发的研究,不是产品发布或旗舰模型,所以重要性给到 78 分比较合适。一个 Functional Token 搞定视觉推理这个 hook 确实抓人,正文也给了数据集和训练方法的细节,对做多模态和 agent 的团队有参考价值。但正文没披露实际部署成本或大规模验证结果,这点先别太激动。

AI HOT 精选

可塑界面:AI 让软件界面按需变形,不再只有一种固定样子

Salesforce 已经“砍掉”了传统界面,销售不用登录网站就能通过 AI 更新交易记录。作者把这种趋势叫做“可塑界面”——AI 能根据你当下在干嘛,动态生成最适合的交互形式,比如开车时给你念邮件摘要、审文案时弹出网页应用、做预算时直接给个带图表的表格。文章引用了 Airbnb CEO 和 Anthropic 工程师的观点,认为纯文本对话不够用,电商...

推荐理由:我会先打个折:这篇是软件形态的展望,没有上线时间、用户数据或可复现的测试,所以放在评论类里刚好。正文说 Salesforce 已经用无头架构让销售靠 AI 直接改数据,界面不再写死,而是按场景动态生成 HTML、音频甚至网页。这点先别太激动——正文没披露这套动态生成在 Salesforce 里的实际覆盖范围、延迟和出错率,也没说 MCP 具体怎么接。但思路本身对做 B 端产品的人有用,因为它把“界面”从设计稿变成了模型输出,省不省开发成本另说,至少交互逻辑要重想。

AI HOT 精选

Runway 上线 Aleph 2.0 和 Edit Studio,把生成、剪辑、后期塞进一个平台

Runway 把新模型 Aleph 2.0 直接做成了一个叫 Edit Studio 的剪辑工具,主打用自然语言改视频,改之前还能先预览效果。从页面看,它把视频生成、多镜头合成、场景搭建、画质增强、动作捕捉和物体移除这些功能都打包在一起了,想覆盖从创意到出片的完整流程。不过正文没披露 Aleph 2.0 的具体技术参数、定价和推送范围,实际效果和成本还...

推荐理由:Runway 是 AI 视频领域的主要玩家,这次更新属于中等体量的产品动作。我会先打个折:标题听起来挺大,但正文没给价格、没给参数、没给上线范围,所以实际能判断的东西有限。HKR 三项都能过——一句话能讲清卖点,有具体新名字,也踩中了行业竞争的脉络——但信息缺口让它停在 featured 这档,再往上就缺硬证据了。

5月21日星期四

TechCrunch · AI

Hark 拿了 7 亿美元 A 轮,要做一套神秘的“通用”AI 交互界面

Hark 这家 AI 公司刚宣布融了 7 亿美元,估值直接拉到 60 亿。他们想做一个能跨 App、跨设备干活的个人 AI 助手,今年夏天先放出能同时处理文字、图像、声音的多模态模型,之后再推专用硬件。但正文没披露具体投资人名单之外的细节,也没说模型参数、性能基准、硬件长什么样、什么时候能买到。7 亿这个数在 A 轮里大得有点吓人,我会先打个折看——毕...

推荐理由:HKR 三项都站得住:7 亿美元 A 轮让 Hark 一下子成了 AI 界面赛道里不能忽视的玩家。不过正文没披露投资方、估值、模型参数和硬件时间表,信息缺口不小,所以放在 featured 而不是 must-write。我会先打个折——钱是真多,但东西还没见着,这点先别太激动。

新智元 · 公众号

中科大两篇顶会论文:教多模态大模型持续学新知识,同时不忘旧本事

中科大团队在顶会上发了两篇工作,专门解决多模态大模型“学新忘旧”的问题。一篇是 MMEVOKE,搞了一个包含 159 个子类、9422 个样本的评测集,用来检验模型在持续学习中会不会把之前的知识覆盖掉。另一篇是 KORE,提出用知识树扩充样本,再通过零空间约束微调来减少遗忘。正文没披露具体性能数字和训练成本,但思路很明确:让模型像人一样,学了新东西还能...

推荐理由:HKR-K 和 HKR-R 都站得住:文章给出了数据集规模和具体的微调机制。不过这只是论文阶段的知识注入方案,没有生产环境的验证或完整的复现细节,所以先打个折,放在低 featured 档。

机器之心 · 公众号

VAST 和清华搞了个新方法,让 3D 生成把算力花在刀刃上,高斯点数量砍半画质还能打

这篇论文正文被微信环境验证挡住了,看不到具体技术细节。从标题和已知信息看,他们提出了一种叫 DeG 的 3D 生成方法,核心思路是让模型自己学会在物体细节丰富的地方多放高斯点、在平坦区域少放点,而不是均匀撒点。这样能用不到一半的高斯点数量,达到跟 TRELLIS 差不多的画面质量。相当于用更少的算力跑出同级别的 3D 模型,对做实时渲染或者要在手机上跑...

推荐理由:我会先打个折:正文只说了“部分场景”达到 TRELLIS 相近画质,没给全量对比,所以别直接当成全面超越。但 DeG 这套密度控制方法确实把“算力花在刀刃上”落到了具体机制里——用渲染损失梯度去学哪里该多放高斯球、哪里该省,比均匀撒点聪明。SIGGRAPH 论文本身有一定技术门槛,不过对做 3D 生成的人,这个效率提升方向值得跟。

机器之心 · 公众号

谢赛宁团队发布第二代表征自编码器 RAEv2,训练效率大幅提升

谢赛宁团队、Adobe Research 和澳大利亚国立大学放出了 RAEv2。在 ImageNet-256 上训练 80 轮后,生成质量指标 gFID 做到了 1.06。更关键的是效率:衡量收敛速度的 EPFID@2 从上一代需要的 177 轮训练直接压缩到 35 轮,计算量维持在 189 GFLOPs 没涨。不过正文因为微信环境验证拦截,具体用了什...

推荐理由:谢赛宁团队放出了第二代表征自编码器 RAEv2,核心卖点是训练快了很多——原来要 177 个 epoch 才能拿到的 EPFID@2 分数,现在 35 个 epoch 就搞定,ImageNet-256 上 80 epoch 的 gFID 压到 1.06。对做图像生成的团队来说,这意味着用更少的算力、更短的等待时间就能验证想法,成本上会友好不少。不过正文没披露模型参数量和实际推理延迟,这点先别太激动,等他们把推理侧的账算清楚再看。

AI HOT 精选

腾讯发布操作系统层级的 AI 助手“马维斯”,Windows、Mac、安卓同步上线

腾讯公关总监张军宣布 AI 助手“马维斯”正式上线,覆盖 Windows、Mac 和安卓。它不是一个普通的聊天窗口,而是直接长在系统层,能理解文件结构、归类解析文档、识别处理图片,甚至帮你修电脑。官方说市面上 Agent 能做的事它基本都能做,还能调度不同模型、在电脑上操控手机应用。比较实在的一点是,它预装了不少本地模型,通过路由机制把轻量任务分给本地...

推荐理由:腾讯把 AI 助手直接做进操作系统层,Windows、Mac、安卓一起发,能读文档、识图、做系统维护,还能跨设备操控,部分功能离线可用。我会先打个折:正文没披露背后的模型、定价和权限设计细节,所以目前只能看到产品形态,看不到技术底牌。这点先别太激动,但三端同步和系统级操控确实把桌面 agent 的竞争往前推了一步,对做 agent 和端侧部署的团队来说是个值得盯的样本。