跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 221–240 条 · 共 514 条

5月26日星期二

AI HOT 精选

商汤把 SenseNova-U1 的训练代码全开源了,一个框架同时训生图、修图、交错生成和理解

OpenSenseNova 在 GitHub 上放出了 SenseNova-U1 的完整训练代码,用 Apache-2.0 协议。代码覆盖了 8B 稠密模型和 A3B MoE(混合专家)架构,在一个统一框架里支持四种多模态任务:文生图、图片编辑、图文交错生成,以及文本与视觉理解。工程上为大规模训练做了准备,支持混合并行、流式可恢复的数据管线、用环境变量...

推荐理由:这条消息的卖点是“完整训练代码开源”,不是常见的只放权重。8B 密集和 A3B MoE 两种模型规格都给了,Apache-2.0 协议也干净。不过正文没披露训练用了多少数据、多少算力,也没有任何评测结果,所以实际效果和训练成本现在没法判断。我会先打个折:代码开源本身值得关注,但别急着对标闭源模型,等社区跑出结果再说。

AI HOT 精选

Runway 发布 Project Luxo,用三部短片和一支广告证明 AI 视频已经跨过恐怖谷

Runway 放出了三部完全用 AI 生成的短片和一支广告样片,每部都由单人完成,制作时间从三周压缩到四小时。他们把这些片子拿给制片人、演员、工会成员和媒体看,得到的反馈是:观众不再盯着画面瑕疵,而是被故事本身抓住了。Runway 认为这意味着 AI 视频的视觉真实感、角色稳定性和创作可控性已经够用,技术开始退到幕后,故事走到了台前。不过正文没披露具体...

推荐理由:这是 Runway 的研究展示和样片发布,不是新模型或已上线的产品功能。给出的 4 小时出片数字很抓眼球,但正文没披露这个流程里人工修改了多少轮、失败率多高,所以我会先打个折。整体属于高质量展示,但离验证过的生产力工具还差一步。

阿里技术 · 公众号

南大和阿里发现 DiT 里的残差流拖慢收敛,改用跨层路由后训练快了近 9 倍

南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法,把 DiT 模型里固定的残差累积,换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试,FID 从 9.67 降到了 7.56,而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截,具体怎么实现路由、...

推荐理由:我会先打个折:这还是一个针对DiT架构的训练方法改进,不是新模型或产品发布,所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈,然后用一个时间感知的路由去替代固定累加,效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人,这个省钱省时间的信号够强,featured没问题。

量子位 · 公众号

浙大和阿里给生图模型加了个“先想再画”的模块,画数独、烧蜡烛这类精细活终于不翻车了

这篇论文提出了一个叫 Unified Thinker 的独立规划模块,专门解决生图模型一遇到需要精确空间推理的任务就乱来的问题。它不像以前那样让模型边想边画,而是把“思考”和“执行”拆开:先让模型生成结构化的推理步骤,再把这些步骤翻译成具体的视觉指令去生图。训练用了 4 万条叫 HieraReason-40K 的样本,分两阶段做强化学习,让模型学会在动...

推荐理由:这篇论文解决的是一个很实际的问题:多模态模型经常在需要一步步操作的视觉任务里翻车,比如画数独格子画错、烧蜡烛的步骤搞反。浙大和阿里的做法是给模型加一个独立的规划模块,用 4 万条专门构造的样本训练它先想清楚再下笔,再通过两阶段强化学习把思考过程转成可执行的视觉指令。正文没披露这个规划模块的具体参数量和推理延迟,所以实际部署成本还不好判断。但思路本身挺直接,如果规划模块够轻量,对提升视觉 agent 的可靠性会有帮助。

AI HOT 精选

Grok Build 测试版上线,SuperGrok 用户能直接用它做图、剪视频和跑自动化脚本

xAI 把 Grok Build 的测试版开放给了所有 SuperGrok 和 X Premium+ 用户。这次主要给了三个东西:Plan Mode 可以分步骤拆解任务;Imagine 模块能直接生成图片和视频;还有一个命令行工具(CLI),方便你把 Grok 接进自动化流程或者编排器里干活。想试的话去 x.ai/cli 就能开始。

推荐理由:HKR 三项都踩中了:xAI 放出一个付费测试版,功能名目列得清楚。分数卡在 featured 底线,因为正文没写能力边界、没给定价、也没测试数据,我会先打个折——东西看着热闹,但能跑多稳、花多少钱,现在还不知道。

5月25日星期一

r/LocalLLaMA

NuExtract3 发布:一个 4B 开源视觉模型,能把图片和文字转成 Markdown、做 OCR 和按模板抽信息,自己电脑就能跑

Numind 放出了 NuExtract3,一个基于 Qwen3.5-4B 的开源视觉语言模型,用 Apache-2.0 协议。它主要干三件事:把图片或文字转成 Markdown 格式、从图片里直接识别文字(OCR)、以及按你给的 JSON 模板把非结构化内容抽成结构化数据。模型只有 4B 参数,对硬件要求不高,官方说最低 4GB 显存就能在本地部署。...

推荐理由:NuExtract3 把一个 4B 大小的开源视觉模型打包成了文档抽取工具,支持 OCR、转 Markdown 和按你给的 JSON 模板把内容抽出来。最吸引人的是它最低只要 4GB 显存就能在自己机器上跑,这对在意数据不出本地的团队来说省了不少事。模型基于 Qwen3.5-4B,用 Apache-2.0 协议,没有授权上的坑。不过正文没给出具体的抽取准确率或延迟数据,实际效果得自己测一下才知道。

机器之心 · 公众号

众趣科技开源浏览器端3D高斯泼溅查看器,10亿个高斯点也能跑,内存和速度都比李飞飞团队的Spark 2.0强

众趣科技把他们的Aholo Viewer开源了,这是一个在浏览器里直接看3D高斯泼溅场景的工具。在300万个高斯点的测试里,它占用的内存只有Spark 2.0的一半,加载速度快了一倍,渲染速度快了两倍,而且宣称能撑住10亿个高斯点的场景。不过正文因为环境验证没抓到具体技术细节,我会先打个折:实际效果得自己跑一下才知道,但光看这几个数字,在网页端做大规模...

推荐理由:这条消息我会打个80分。群核科技这次开源的不是基础模型,而是一个3D渲染工具,但“10亿高斯点塞进浏览器”这个钩子很直观,性能对比也给了具体数字,不是空口说快。对从业者来说,浏览器端能跑这种量级的场景,部署上确实省事省钱。不过正文没披露10亿点场景的具体交互帧率,这点先别太激动,等他们后续补数据。

5月24日星期日

机器之心 · 公众号

ICML 2026 中了一篇让视觉模型学会“多条思路并行思考”的论文,但正文被验证页挡住了

这篇被 ICML 2026 接收的论文叫 Visual Para-Thinker,给视觉语言模型加了一套并行思考框架。核心是用 Pa-Attention 和 LPRoPE 把视觉推理拆成四条独立路径,让模型同时从不同角度理解图像,再综合出答案。训练数据是 16.3 万组问答对,规模不算大,所以泛化能力得打个问号。不过目前文章页面被微信环境异常验证挡住了...

推荐理由:这篇 ICML 2026 论文给视觉语言模型装了一个并行思考框架,叫 Visual Para-Thinker。核心是把视觉推理拆成 4 条路径同时跑,用 Pa-Attention 和 LPRoPE 做隔离,防止路径间串味。训练数据是 16.3 万对问答,规模不算大,但够验证想法。我会先打个折:这是单篇研究,没有多团队复现或产品落地,所以重要性停在 79。对做多模态推理加速和内部机制拆解的人,这篇值得看,但别当成熟方案直接用。

新智元 · 公众号

Anthropic 三张底牌全翻:Mythos 1 首次现身,Opus 4.8 被扒出

Anthropic 的新模型和项目被提前曝光了。claude-opus-4.8 的名字出现在 Google Vertex AI 平台上,同时一份 59.8MB 的 Claude Code 源码映射文件泄露,里面 51.2 万行 TypeScript 代码不仅提到了 Sonnet 4.8,还带出了 Mythos 1 的线索。Mythos 1 看起来和 C...

推荐理由:我会先打个折:这是泄露加平台列表,不是 Anthropic 官方发布。正文没披露能力分数、定价、上下文窗口或可复现评测,所以分数卡在 78–84 区间。但 Mythos 1 第一次被挖出来,Opus 4.8 又在 Vertex 上露脸,对关注 Anthropic 路线图的人来说信息量不小,值得放进 featured。

r/LocalLLaMA

视觉模型直接读 PDF vs 先 OCR 再问答:一次长文档实测

作者用 Claude Sonnet 4.5 跑了 MMLongBench-Doc 里的 30 份带图、带表格的 PDF,共 171 道题,对比两种路线:让模型直接看 PDF 画面,和先用 OCR 把文档转成文字再喂给模型。直接看 PDF 的准确率只有 52.0%,在六套方案里排第五,每次查询成本 0.2552 美元。表现最好的是 LlamaCloud ...

推荐理由:作者拿 Claude Sonnet 4.5 直接读 PDF 图片,在 MMLongBench-Doc 上跑出 52.0% 准确率,每题烧掉 0.2552 美元,比 LlamaCloud 的 OCR 管线低了 7.6 个百分点。样本只有 30 份文档、171 道题,结论别急着推广,但至少说明现在原生视觉模型处理带图表的长文档还不稳,而且贵。正文没披露具体文档类型分布和问题难度,这点先打个折。

5月23日星期六

机器之心 · 公众号

FlashAR 用 0.05% 的训练数据,把自回归图像模型的生成速度提了 22.9 倍

浙大和阿德莱德大学搞了个 FlashAR,专门给预训练好的自回归图像模型加速。拿 Emu3.5-Image-34B 试了一下,生成一张 512×512 的图,原来要 130.10 秒,现在只要 5.68 秒,快了 22.9 倍。而且只用了原始训练数据量的 0.05% 做微调,GenEval 分数从 80.48 变成 80.29,画质基本没掉。正文没披露...

推荐理由:FlashAR 用极少量数据给预训练好的自回归图像模型做加速,速度提升 22.9 倍,质量几乎没掉,对在意推理延迟和成本的团队是个好消息。论文给了具体数字和 GenEval 对比,信息量够,但正文没披露这 0.05% 数据具体怎么选、不同分辨率下是否同样有效,这点先别太激动。整体是扎实的推理优化工作,不是顶级实验室的模型发布,放 featured 合适。

The Verge · AI

上手 Gemini Omni:什么都能转什么都能生,我先拿毛绒玩具试了试

作者去年用 Gemini 给儿子的毛绒鹿做过一段度假视频,没给孩子看,但这件事让他反复琢磨“无害的 AI 乐子”和“纯 AI 垃圾”之间的那条线。这次上手 Gemini 的“任意输入、任意输出”新模型,他再次拿那只毛绒鹿做了一段 deepfake 视频,发现生成逼真视频的工具已经好用到几乎不需要技术门槛,而且这个趋势还在加速。正文没披露模型参数量、定价...

推荐理由:这篇值得推,因为 The Verge 上手玩了一个很唬人的 Gemini 新模型,用一张毛绒鹿照片直接生成视频,效果够“野”。但我会先打个折:全文就一个例子,没参数没价格没时间表,属于尝鲜体验不是产品发布。H 和 R 都过关,K 卡在信息太少,所以整体给 featured 但别当硬核技术稿看。

r/LocalLLaMA

美团 LongCat 放出视频数字人模型 1.5 版,换用 Whisper 做语音驱动,推理步数压到 8 步

美团 LongCat 在 Hugging Face 上发了 LongCat-Video-Avatar-1.5,模型权重用 MIT 协议开源。它能做音频驱动视频、音频加图片驱动视频,还能接着一段视频往后生成。这版把语音编码器从 Wav2Vec2 换成了 Whisper-Large,理论上对语音的理解会更准。推理部分用 DMD2 蒸馏把步数降到了 8 NF...

推荐理由:我会先打个折:这不算行业地震级别的发布,但对做开源视频数字人的团队来说是个实在的更新。H、K、R 三条都站得住——美团 LongCat 把模型权重用 MIT 协议放出来,推理压到 8 NFE,意味着本地跑起来的门槛低了不少。技术上,它把语音编码器从 Wav2Vec2 换成 Whisper-Large,对中文语音的适配可能会更好,但正文没给出具体的对比测试数据,这点先别太激动。如果是真的省钱又好用,对想自己搭数字人、不想走云端 API 的开发者来说,是个值得上手试试的选项。

AI HOT 精选

Gemini 月活破 9 亿,新增两个能替你干活的代理功能

Google 说 Gemini 应用月活用户超过 9 亿了。这次更新把 Gemini 从问答工具往主动干活的个人代理方向推了一步。新模型叫 Gemini 3.5 Flash,还换了套叫“Neural Expressive”的设计语言,另外 Gemini Omni 模型能把提示词直接生成视频。重点在两项代理功能:Daily Brief 会给你出个性化每日...

推荐理由:Google 这次更新核心就两件事:一是 Gemini 应用月活冲到 9 亿,盘子确实大;二是推出了 Daily Brief 和 Gemini Spark 两个代理功能,后者可以在用户授权下 24 小时跑任务。我会先打个折,正文没披露代理功能的具体完成率和延迟数据,实际干活靠不靠谱还不知道。但 9 亿这个量级加上“常驻后台的个人代理”定位,对做 agent 产品的团队来说是个明确的信号——大厂开始用自家分发渠道推代理了,竞争门槛在抬高。

5月22日星期五

TechCrunch · AI

Google 的 AI 眼镜我们上手试了,离好用就差一口气

Google 在 I/O 大会上给了一小段上手时间,试的是带显示功能的 Android XR 眼镜,不是今年秋天只出声的那款。镜片上能直接叠一层信息,比如天气、步行导航、打车详情和实时翻译,还能用 AI 自己捏小组件。眼镜会同时支持 iPhone 和安卓手机。但正文没提价格、什么时候开卖、续航和具体硬件参数,所以现在只能算工程机阶段,别急着掏钱。

推荐理由:我会先打个折:正文没披露价格、上市时间和续航,所以重要性停在 74 分、放在 featured 低位是合理的。但 TechCrunch 的实际上手测试本身就比通稿有说服力,Gemini 把翻译和导航叠进视野这个机制,是把 AI 从“问一句答一句”推到“你看着世界它帮你理解”的关键一步。对从业者来说,这比又一个聊天机器人更新更值得盯。

AI HOT 精选

Project Genie 接入谷歌街景,能把美国真实地点变成可交互世界

Project Genie 和谷歌地图街景打通了,现在你可以把美国真实地点直接转成能走进去玩的交互式世界。正文没披露具体支持哪些城市、生成机制、收费方式,也没说开放范围有多大。

推荐理由:Project Genie 跟谷歌街景合作,把美国真实地点变成能走进去互动的世界。我会先打个折——正文没写具体城市、生成机制和开放范围,所以别当产品发布看。但如果是真的,用街景数据直接生成可交互环境,省掉建模成本,这点对做仿真和世界模型的人挺有吸引力。

AI HOT 精选

网易有道把“子曰4”的多模态模型和语音合成模型都开源了

这次开源的是一个270亿参数的多模态模型和一个语音合成模型。多模态模型主要针对教育场景,能看懂带图表的数学题,在纯中文数理难题上准确率81.4%。团队用精简过的推理样本做训练,把模型思考过程的输出长度压缩了43.2%,所以回答同样的问题,吐出的token更少、推理更快,直接效果就是推理成本会降下来。语音合成模型支持用3秒中文音频克隆音色,能跨14种语言...

推荐理由:我会先打个折:有道不是前沿大模型实验室,所以这条消息的份量到不了顶流,但信息本身够具体。27B 参数的多模态模型,中文数理题做到 81.4% 准确率,说明在中文理科场景有一定可用性,不过正文没披露评测集和对比基线,这点先别太激动。语音模型覆盖 14 种语言,对做多语言 TTS 产品的人是个直接可用的资源。全量开源意味着可以直接拿来微调或部署,省去从头训的成本,但实际推理开销和显存需求正文没提,动手前得自己测一下。整体看,这是一次信息完整、可验证的发布,对关注中文多模态和语音落地的从业者有实操参考价值。

Hacker News 首页

宾州一所高中被 AI 换脸裸照撕裂

404 Media 报道,宾州拉德诺高中一名高一男生花了 250 美元订阅 App Store 里的 Movely 应用,把五名女同学的脸贴到裸体上,生成了 AI 儿童性虐待材料。事情发生在 2025 年 12 月,男生事后用学校发的设备在 Snapchat 上跟朋友说“每一分钱都花得值”,第二天他没去上学,但女生们去了,还发现男生们在替他打掩护。文章...

推荐理由:404 Media 挖出的这个案子很具体:Radnor 高中 5 名女生被同学用 AI 生成假裸照,涉事新生承认花 250 美元买了 Movely 订阅。正文没提警方后续怎么处理,也没说学校有没有启动调查,这点信息是缺的。但光凭受害者全是未成年人、工具成本明确这两条,就足够让关注 AI 安全的人绷紧神经——这不是模型跑分翻车,是真实世界里已经发生的伤害。

机器之心 · 公众号

CVPR 2026 | HiF-VLA:用视频压缩的思路教机器人“边看动作边想下一步”

西湖大学团队搞了个叫 HiF-VLA 的框架,核心想法是把机器人看世界的方式从“一帧帧静态图”换成“画面怎么动的”。它直接用 H.264 这类视频编码器从画面里提取紧凑的运动向量,再让一个联合专家模型同时预测未来的视觉动态和该做的动作序列。论文里给的数据是,在设定的历史窗口下,显存峰值 31.4GB,延迟 117.7 毫秒。不过正文因为环境验证问题没加...

推荐理由:这篇 HiF-VLA 我会先打个折:它还是一个单篇研究,没有落地案例或多方交叉验证,所以放在 featured 低位。但它的思路确实比多数 VLA 论文更“省”——直接用 H.264 运动向量代替逐帧视觉编码,把“看变化”和“想动作”塞进联合专家里一起算,显存压到 31.4GB、延迟 117.7ms,对想在真机上跑实时推理的团队是个可参考的方向。正文没披露在真实机械臂上的成功率或与主流 VLA 的 head-to-head 对比,这点先别太激动。

机器之心 · 公众号

Meta 华人团队发布 ATLAS:用一个词让视觉模型学会可泛化的推理

Meta AI 和港中文的研究者搞了个叫 ATLAS 的方法,核心是在视觉语言模型里塞一个“功能词”(Functional Token),让模型能同时走两条路:一条是显式的、一步步调用工具去操作图像(Agentic 推理),另一条是隐式的、在内部潜空间里直接算(Latent 推理)。他们配套搞了个 ATLAS-178K 数据集,分两阶段训练——先做监督...

推荐理由:我会先打个折:这是 Meta AI 和港中文联合发的研究,不是产品发布或旗舰模型,所以重要性给到 78 分比较合适。一个 Functional Token 搞定视觉推理这个 hook 确实抓人,正文也给了数据集和训练方法的细节,对做多模态和 agent 的团队有参考价值。但正文没披露实际部署成本或大规模验证结果,这点先别太激动。