跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 241–260 条 · 共 514 条

5月22日星期五

AI HOT 精选

可塑界面:AI 让软件界面按需变形,不再只有一种固定样子

Salesforce 已经“砍掉”了传统界面,销售不用登录网站就能通过 AI 更新交易记录。作者把这种趋势叫做“可塑界面”——AI 能根据你当下在干嘛,动态生成最适合的交互形式,比如开车时给你念邮件摘要、审文案时弹出网页应用、做预算时直接给个带图表的表格。文章引用了 Airbnb CEO 和 Anthropic 工程师的观点,认为纯文本对话不够用,电商...

推荐理由:我会先打个折:这篇是软件形态的展望,没有上线时间、用户数据或可复现的测试,所以放在评论类里刚好。正文说 Salesforce 已经用无头架构让销售靠 AI 直接改数据,界面不再写死,而是按场景动态生成 HTML、音频甚至网页。这点先别太激动——正文没披露这套动态生成在 Salesforce 里的实际覆盖范围、延迟和出错率,也没说 MCP 具体怎么接。但思路本身对做 B 端产品的人有用,因为它把“界面”从设计稿变成了模型输出,省不省开发成本另说,至少交互逻辑要重想。

AI HOT 精选

Runway 上线 Aleph 2.0 和 Edit Studio,把生成、剪辑、后期塞进一个平台

Runway 把新模型 Aleph 2.0 直接做成了一个叫 Edit Studio 的剪辑工具,主打用自然语言改视频,改之前还能先预览效果。从页面看,它把视频生成、多镜头合成、场景搭建、画质增强、动作捕捉和物体移除这些功能都打包在一起了,想覆盖从创意到出片的完整流程。不过正文没披露 Aleph 2.0 的具体技术参数、定价和推送范围,实际效果和成本还...

推荐理由:Runway 是 AI 视频领域的主要玩家,这次更新属于中等体量的产品动作。我会先打个折:标题听起来挺大,但正文没给价格、没给参数、没给上线范围,所以实际能判断的东西有限。HKR 三项都能过——一句话能讲清卖点,有具体新名字,也踩中了行业竞争的脉络——但信息缺口让它停在 featured 这档,再往上就缺硬证据了。

5月21日星期四

TechCrunch · AI

Hark 拿了 7 亿美元 A 轮,要做一套神秘的“通用”AI 交互界面

Hark 这家 AI 公司刚宣布融了 7 亿美元,估值直接拉到 60 亿。他们想做一个能跨 App、跨设备干活的个人 AI 助手,今年夏天先放出能同时处理文字、图像、声音的多模态模型,之后再推专用硬件。但正文没披露具体投资人名单之外的细节,也没说模型参数、性能基准、硬件长什么样、什么时候能买到。7 亿这个数在 A 轮里大得有点吓人,我会先打个折看——毕...

推荐理由:HKR 三项都站得住:7 亿美元 A 轮让 Hark 一下子成了 AI 界面赛道里不能忽视的玩家。不过正文没披露投资方、估值、模型参数和硬件时间表,信息缺口不小,所以放在 featured 而不是 must-write。我会先打个折——钱是真多,但东西还没见着,这点先别太激动。

新智元 · 公众号

中科大两篇顶会论文:教多模态大模型持续学新知识,同时不忘旧本事

中科大团队在顶会上发了两篇工作,专门解决多模态大模型“学新忘旧”的问题。一篇是 MMEVOKE,搞了一个包含 159 个子类、9422 个样本的评测集,用来检验模型在持续学习中会不会把之前的知识覆盖掉。另一篇是 KORE,提出用知识树扩充样本,再通过零空间约束微调来减少遗忘。正文没披露具体性能数字和训练成本,但思路很明确:让模型像人一样,学了新东西还能...

推荐理由:HKR-K 和 HKR-R 都站得住:文章给出了数据集规模和具体的微调机制。不过这只是论文阶段的知识注入方案,没有生产环境的验证或完整的复现细节,所以先打个折,放在低 featured 档。

机器之心 · 公众号

VAST 和清华搞了个新方法,让 3D 生成把算力花在刀刃上,高斯点数量砍半画质还能打

这篇论文正文被微信环境验证挡住了,看不到具体技术细节。从标题和已知信息看,他们提出了一种叫 DeG 的 3D 生成方法,核心思路是让模型自己学会在物体细节丰富的地方多放高斯点、在平坦区域少放点,而不是均匀撒点。这样能用不到一半的高斯点数量,达到跟 TRELLIS 差不多的画面质量。相当于用更少的算力跑出同级别的 3D 模型,对做实时渲染或者要在手机上跑...

推荐理由:我会先打个折:正文只说了“部分场景”达到 TRELLIS 相近画质,没给全量对比,所以别直接当成全面超越。但 DeG 这套密度控制方法确实把“算力花在刀刃上”落到了具体机制里——用渲染损失梯度去学哪里该多放高斯球、哪里该省,比均匀撒点聪明。SIGGRAPH 论文本身有一定技术门槛,不过对做 3D 生成的人,这个效率提升方向值得跟。

机器之心 · 公众号

谢赛宁团队发布第二代表征自编码器 RAEv2,训练效率大幅提升

谢赛宁团队、Adobe Research 和澳大利亚国立大学放出了 RAEv2。在 ImageNet-256 上训练 80 轮后,生成质量指标 gFID 做到了 1.06。更关键的是效率:衡量收敛速度的 EPFID@2 从上一代需要的 177 轮训练直接压缩到 35 轮,计算量维持在 189 GFLOPs 没涨。不过正文因为微信环境验证拦截,具体用了什...

推荐理由:谢赛宁团队放出了第二代表征自编码器 RAEv2,核心卖点是训练快了很多——原来要 177 个 epoch 才能拿到的 EPFID@2 分数,现在 35 个 epoch 就搞定,ImageNet-256 上 80 epoch 的 gFID 压到 1.06。对做图像生成的团队来说,这意味着用更少的算力、更短的等待时间就能验证想法,成本上会友好不少。不过正文没披露模型参数量和实际推理延迟,这点先别太激动,等他们把推理侧的账算清楚再看。

AI HOT 精选

腾讯发布操作系统层级的 AI 助手“马维斯”,Windows、Mac、安卓同步上线

腾讯公关总监张军宣布 AI 助手“马维斯”正式上线,覆盖 Windows、Mac 和安卓。它不是一个普通的聊天窗口,而是直接长在系统层,能理解文件结构、归类解析文档、识别处理图片,甚至帮你修电脑。官方说市面上 Agent 能做的事它基本都能做,还能调度不同模型、在电脑上操控手机应用。比较实在的一点是,它预装了不少本地模型,通过路由机制把轻量任务分给本地...

推荐理由:腾讯把 AI 助手直接做进操作系统层,Windows、Mac、安卓一起发,能读文档、识图、做系统维护,还能跨设备操控,部分功能离线可用。我会先打个折:正文没披露背后的模型、定价和权限设计细节,所以目前只能看到产品形态,看不到技术底牌。这点先别太激动,但三端同步和系统级操控确实把桌面 agent 的竞争往前推了一步,对做 agent 和端侧部署的团队来说是个值得盯的样本。

The Verge · AI

YouTube Shorts 现在能用 AI 把别人的视频改成动画或给你换头

YouTube 给 Shorts 的“混剪”功能加了一个叫“重新想象”的选项,背后用的是 Gemini Omni 模型。你可以直接拿别人发过的短视频,让 AI 把画面风格改成动漫、替换画面里的东西,或者把自己的脸塞进原视频里。创作者可以在上传时决定允不允许别人用 AI 改动自己的内容。正文没提生成一次要多久、有没有水印,也没说免费用户能用几次。

推荐理由:Google 给 YouTube Shorts 的 Remix 加了个 reimagine 模式,用 Gemini Omni 直接改别人的短视频。我会先打个折:这不是新模型发布,是个产品功能更新,所以放在低 featured 档。但它的传播力很强,因为“混剪别人视频”这个动作本身就自带话题,而且创作者能选择关掉,这点在授权上算给了台阶。正文没披露这个功能什么时候全量上线,也没说对视频时长、分辨率的限制,这些缺口让实际影响还得再观察。

5月20日星期三

Hacker News 首页

字节跳动开源 Lance:一个模型同时搞定图片和视频的理解、生成与编辑

Lance 是字节跳动放出的一个多模态研究项目,把看图、看视频、生成图片、生成视频和编辑这些事塞进了同一个模型里。模型激活参数只有 3B,个头不大,训练用了不到 128 张 GPU,对想复现或微调的人来说门槛不算高。代码、论文和模型权重都公开了,但项目页没写具体的 benchmark 跑分和商用许可条款,这点先别太激动,得自己去翻论文和 HF 页面确认。

推荐理由:字节跳动的 Lance 把图像和视频的生成、理解塞进一个模型,激活参数 3B,训练用了不到 128 块 GPU。我会先打个折:正文没披露 benchmark 成绩、没放真实生成样本,授权协议也没说清楚,所以现在只能当研究发布看,别急着对标成熟产品。但单模型覆盖多模态这个方向,对想省部署成本的小团队确实有吸引力。

The Verge · AI

AI 内容打标签这事,到了见真章的时候

Google 在 I/O 大会上说,现在能更广地验证 SynthID 给 AI 图片打的水印了;另一边 C2PA 也在推一套叫 Content Credentials 的标准,想给图片、视频、音频都加上来源元数据。说白了,就是两套技术路线在比赛谁能更靠谱地告诉你“这东西是不是 AI 生成的”。但文章没具体说这次 SynthID 的验证范围到底铺到了多大...

推荐理由:这条消息本身有料,但正文没给出完整覆盖范围、落地时间表和实际采用数据,所以我会先打个折。它更像一次中量级的溯源更新,不是那种必须立刻写的重磅发布。

新智元 · 公众号

驭势科技在港交所上市,成为全场景L4自动驾驶第一股,市值超百亿港元

驭势科技今天在港交所挂牌,发行价每股60.30港元,公开发售部分超额认购6777倍。公司主要做机场、厂区这类封闭场景的L4级无人驾驶物流车和接驳车,2025年在大中华区机场L4商用车市场占了90.5%的份额。不过原文因为微信环境验证拦截,正文内容没抓到,具体的财务数据、技术路线和募资用途都没披露,这些关键信息得去翻招股书才能确认。

推荐理由:驭势科技港股上市,机场 L4 商用车市占率做到九成,公开发售被抢了六千多倍,说明市场对自动驾驶商业化这条路的买单意愿很强。不过正文没披露营收和盈利情况,光看市占率还判断不了生意本身赚不赚钱,这点先别太激动。

AI HOT 精选

Kling AI 上线原生 4K 视频生成,不再靠后期放大,直接出真 4K

Kling AI 在 4 月 23 日放出一个原生 4K 视频生成模型,不是先做低分辨率再放大,而是从生成阶段就按 4K 来跑。官方说好莱坞团队和 Wonder Studios 已经在用,制片人反馈这是他们工作流里第一个原生 4K 基础模型,Wonder Studios 特别提到原生生成能避免传统放大带来的角色变形,画面一致性更好。不过正文没披露价格、...

推荐理由:我会先打个折:这是厂商自己发的消息,不是第三方评测。能一键出原生4K确实少见,也报了合作方名字,所以给了featured。但没给任何可比的硬指标——生成一段4K要多久、花多少钱、最长能出多少秒,这些全没说。这点先别太激动,等实测出来再看。

机器之心 · 公众号

谷歌 I/O 大会后,搜索框直接变成了 AI 智能体入口

谷歌在 I/O 大会上发布了 Gemini 3.5 Flash,并把 AI 模式直接嵌进了搜索框。公司说现在它的 AI 服务每月要处理超过 3200 万亿个 token,已经有超过 850 万开发者在使用 Gemini。不过这篇文章因为微信平台的环境验证问题,正文内容没能加载出来,所以具体的模型参数、性能对比和实际体验细节都没法确认。

推荐理由:谷歌 I/O 这次把模型更新和搜索入口绑在一起推,AI Mode 直接嵌进搜索框,比普通功能发布重得多。Gemini 3.5 Flash 是新的轻量模型,月 token 消耗 3.2 千万亿说明用量已经很大,850 万开发者这个数字也够扎实。我会先打个折:正文没披露 3.5 Flash 的具体 benchmark 对比和定价,实际性价比还得等实测。但就凭搜索框变智能体这一条,当天必须写。

Latent Space

Google I/O 2026:Gemini 3.5 Flash 发布,百万 token 上下文、四种思考模式,主打编程和干活快

Google 在 I/O 大会上把 Gemini 重新定位成消费级 AI 入口和开发者代理平台。最核心的发布是 Gemini 3.5 Flash,今天就能用,上下文窗口 100 万 token,单次最多输出 6.5 万 token,提供“极简/低/中/高”四档思考深度,并且能在多轮对话里保留思考过程。官方说它比 3.1 Pro 更强,尤其在终端操作、编...

推荐理由:Google I/O 这次不是单点发布,是把模型、视频、agent 和开发工具打包一起推。Gemini 3.5 Flash 的定价和上下文窗口摆在那,对做应用的人有直接参考价值;Omni 的视频理解和 Spark 的后台 agent 思路,跟现在行业里追的 agent 落地、多模态成本是同一根神经。我会先打个折——现场 demo 和实际 API 稳定性之间通常有差距,但信息量够、时间点敏感,放 P1 没问题。

AI HOT 精选

通义千问发布 Qwen3.7-Max,主打长时间自主干活和跨平台编程

Qwen 团队推出了 Qwen3.7-Max,一个专为智能体场景设计的闭源模型。它最显眼的能力是能长时间自主执行任务,官方演示了一个连续跑 35 小时、调用上千次工具的内核优化任务。在编程方面,它在 Terminal Bench 2.0 上拿了 69.7 分,超过了 DeepSeek-V4-Pro Max 的 67.9 分;在 SWE-Pro 这类复杂...

推荐理由:Qwen Studio 发了 Qwen3.7,一口气覆盖聊天、图像视频理解、图像生成、文档处理、网页搜索、工具调用和工件生成,摆明要往智能体方向走。我会先打个折:正文没给任何 benchmark、定价、上下文窗口或延迟数据,所以没法判断实际可用性和成本。亮点是工具调用和工件生成这两项,说明模型不只是聊天,而是被设计成能进业务流程干活。这点先别太激动,等看到具体评测和接入方式再说。

AI HOT 精选

Gemini Omni 能拿你的脸和声音做数字分身,以后拍视频不用真人出镜了

Gemini Omni 上线了一个新功能,你可以用自己的长相和声音创建一个数字分身。建好之后,这个分身就能替你出镜生成视频,不用每次都重新上传照片。正文没提这个功能要不要钱、在哪些地区能用、什么时候正式上线,我会先打个折观望。

推荐理由:Gemini Omni 让用户拿自己的形象和声音做数字分身视频,建好之后不用反复传图,这点对做内容的人挺方便。但正文没写价格、哪些地区能用、什么时候上线,所以现在只能当个预告看。我会先打个折:功能听着省事,可落地时间表和成本都不清楚,别太激动。

AI HOT 精选

ChatGPT 图像生成周用量冲到 15 亿次,OpenAI 聊了聊 Images 2.0 带来的新玩法

OpenAI 发推说,现在大家每周在 ChatGPT 里生成超过 15 亿张图片。研究员 kenjihata、产品负责人 adele__li 和主持人 AndrewMayne 一起聊了 Images 2.0 上线后冒出来的新用法和趋势。正文没展开具体是哪些用例,也没给技术细节,就提了个数字和一场对谈。

推荐理由:我会先打个折:正文只给了 15 亿这个总数,没拆地区、模型版本或付费/免费比例,也没说 Images 2.0 具体改了啥。但光这个量级就够说明图像生成已经从尝鲜变成高频刚需,对算力规划和竞品压力都有参考价值。没有新能力或定价信息,所以分数停在 78 不往上拉。

AI HOT 精选

谷歌把 AI 概览和 AI 模式揉进一个搜索框,现在能传图、传文件、传视频问问题

谷歌上线了一个基于 Gemini 3.5 的新搜索框,把之前的 AI Overviews 和 AI Mode 合并成一个入口。你可以打字、传图片、丢文件或发视频,搜索会跨这些格式一起理解你的问题。支持多轮对话,回答会结合上下文更贴近你。桌面和手机端全球同步上线,正文没披露具体延迟和成本数据。

推荐理由:谷歌搜索这次更新,等于把 AI 对话直接嵌进了搜索框,支持文字、图片、文件、视频混着问,还能多轮追问。底层是 Gemini 3.5,把之前的 AI Overviews 和新的 AI Mode 整合在一起,桌面和移动端都上了。对做搜索、做内容、做 AI 产品的人来说,这意味着谷歌的流量分发逻辑在变,跟 Perplexity 那种 AI 搜索的竞争也更直接。不过原文信息偏薄,没写具体交互细节、覆盖地区有没有限制、实际回答质量怎么样,所以重要性我给 86,先别往 90 以上冲。

AI HOT 精选

Google 把 Tensor 芯片的 AI 能力开放给开发者,Pixel 10 手机上的 TPU 现在可以直接跑模型了

Google 发布了 Tensor ML SDK 的公开测试版,开发者现在能把 PyTorch 或 TFLite 模型转换、编译后,直接调用 Pixel 10 系列手机里的 TPU 芯片来跑推理。整个流程通过 LiteRT 这个统一框架完成,不用再分别对接底层硬件驱动。官方还提供了一个模型库,里面有超过 100 个现成的经典模型和生成式 AI 模型,包...

推荐理由:HKR-K 很扎实:文章给出了 Pixel 10 TPU 上的具体工作流和一个 100+ 模型库。H 和 R 也够得上 featured,但这是个测试版开发者 SDK,不是旗舰模型或面向大众的产品发布,所以我会先打个折。

AI HOT 精选

Gemini Omni 发布:能理解物理世界的视频生成模型,面向付费用户开放

Gemini Omni 不只是生成画面,它会判断场景里接下来该发生什么——比如物体掉落、碰撞这类物理规律,同时结合历史、科学和文化知识来构建内容。视频生成功能今天起向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放,可以在 Gemini 应用、Google Flow 和 YouTube Shorts 里用。正文没披露推理的具体技...

推荐理由:我会先打个折:正文只给了发布和接入渠道,没放任何物理推理的测试案例、视频生成的质量对比或具体定价,所以信息密度其实偏薄。但“物理推理+视频生成”这个标签本身够硬,加上直接打通 YouTube Shorts,对关注多模态生成和平台竞争的从业者来说是个明确的信号。基于现有信息,放在 85–94 这个区间偏低的位置是合理的,等有实测数据再往上调。