跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 201–220 条 · 共 514 条

5月30日星期六

机器之心 · 公众号

英伟达和清华的 γ-World 把世界模型从单机改成了联机,登顶 HuggingFace 日榜

这篇推文本身因为微信环境验证没抓到正文,我只能根据已有的英文摘要和标题来还原。γ-World 是一个多智能体世界模型,核心是把多个 AI 角色放在同一个虚拟环境里互动。它用了一种叫“单纯形位置编码”的方法和 hub token 机制,把多个智能体之间的交互计算成本从平方级降到了线性级。说人话就是:以前每加一个角色,系统要算它和所有其他角色的关系,开销涨...

推荐理由:我会先打个折:这是研究发布,还没看到大规模落地验证,但技术点够具体。Gamma-World 解决的是多个 AI 同时在一个世界里交互时计算量爆炸的问题,用正单纯形位置编码让每个智能体知道彼此位置,再靠 hub token 汇总信息,把原本 O(n²) 的复杂度压到 O(n)。8 个玩家延迟压到 4.5ms 这个数挺实在,说明小规模场景已经能跑顺。不过正文没披露更多玩家数下的表现,这点先别太激动。整体属于有干货、有数字、方向对路的研究,给 featured 合理。

AI HOT 精选

OpenAI 放出一个实时翻译语音模型,70 多种语言输入,13 种语言输出

OpenAI 发了 gpt-realtime-translate,一个专门做语音翻译的模型。你对着它说 70 多种语言里的任意一种,它能直接用 13 种目标语言把语音播出来。OpenAI 说大模型虽然强,但特定任务还是得上专用模型。目前这个功能已经在智能眼镜上跑起来了,不过正文没披露延迟、准确率和具体硬件细节。

推荐理由:我会先打个折:正文没提延迟、定价和 API 开放时间,所以实际能不能用、贵不贵还不知道。但 OpenAI 把实时翻译塞进智能眼镜,70多种语言进、13种语言出,这个组合本身是个挺实在的进展,值得从业者看一眼。

The Verge · AI

想拍你干家务,AI 公司开始用免费保洁换训练数据

一家叫 Shift 的 AI 训练初创公司说,可以免费给纽约人打扫房子,条件是允许他们拍摄保洁员干活的全过程:洗碗、擦台面、掸灰、拖地。这些视频会被用来训练家用机器人。公司还计划扩展到伦敦等城市。但正文没披露用户隐私条款、数据保留期限、后续收费模式,也没说具体什么时候进新城市。我会先打个折:免费保洁听着不错,但等于拿你家当机器人训练场,值不值得自己掂量。

推荐理由:我会先打个折:正文没披露视频拍到什么程度、数据保留多久、会不会扩到别的城市,所以别急着说这是机器人数据的灵丹妙药。但 Shift 这个做法确实戳到了一个真问题——教机器人做家务,缺的就是人在真实厨房里刷碗擦台面的视频。用免费保洁来换,比花钱买数据便宜,也比实验室摆拍更像真活。对从业者来说,看点在于这种采集方式能不能规模化,以及用户到底愿不愿意让陌生人架着相机看自己家。这点先别太激动,等他们公布授权条款和隐私处理再说。

5月29日星期五

The Verge · AI

Shift 用免费上门打扫换机器人训练数据,清洁工会全程被录像

一家叫 Shift 的 AI 训练数据公司说,可以免费帮你打扫家里,条件是让他们录下清洁工擦窗、吸尘、整理的全过程,拿这些视频去训练机器人。他们觉得这些数据的价值足够覆盖服务成本,网站上写的是“你得到干净屋子,我们拿到训练数据,双赢”。宣传片里清洁工戴着一顶有点奇怪的帽子干活。不过正文没提服务覆盖哪些城市、怎么处理隐私和知情同意,也没说已经收集了多少数...

推荐理由:HKR-H 和 HKR-R 都很实在:Shift 把家政服务直接变成机器人数据采集管道,话题性够强。HKR-K 有明确机制,但城市范围、隐私条款、数据集规模正文都没披露,所以先别太激动,暂时放在低曝光位。

The Verge · AI

Adobe 的对话式 AI 助手像个平庸的设计实习生

The Verge 提前试了 Adobe Firefly AI 助手的测试版。它不像常规 AI 工具那样直接生成图片或视频,而是充当一个中间人,用对话的方式替你操作 Adobe 的设计软件。作者说,助手解释每一步编辑思路时讲得很清楚,但最终做出来的效果并不让人满意。正文没提定价、正式上线时间,也没列出完整支持哪些软件。

推荐理由:我会先打个折:这是 The Verge 编辑亲自上手 Adobe Firefly AI Assistant 测试版的体验文,不是官方通稿。它能在 Adobe 设计软件里听指令改图,解释流程挺清楚,但成品确实一般,所以标题才叫“平庸的设计实习生”。这点先别太激动,正文没披露定价、什么时候正式上线、具体支持哪些应用,信息有缺口。不过它踩中了设计工作自动化的敏感点——能不能用、好不好用、会不会抢活,所以给到 featured 门槛的分数是合理的。

AI HOT 精选

小米开源 ControlFoley:给视频配音效,可以按你写的提示词或给的参考音频来

小米大模型应用团队放出了一个叫 ControlFoley 的视频音效生成模型,权重和代码都开源了。它主要解决一个问题:以前模型只能看画面自动猜配什么声音,创作者没法干预。ControlFoley 支持三种用法——用文字描述想要的音效、用文字强行覆盖画面里原有的声音、或者上传一段参考音频让它模仿音色和风格,同时还能保证声音和画面动作对得上。团队自己训了一...

推荐理由:ControlFoley 把视频拟音做成可控生成,还直接开源了全套,对创作者和开发者都挺友好。它不是那种刷榜的基础模型发布,但胜在任务明确、工具属性强,放在 featured 门槛附近是合理的。

AI HOT 精选

谷歌 DeepMind 老大说 AGI 可能三年内到,但社会还没准备好

哈萨比斯判断,通用人工智能(AGI)最快 2029 到 2030 年就会出现,比之前想的快很多。他说的 AGI 不是只会干一件活的专用 AI,而是能像人一样跨领域学习、推理和创造的系统。现在那些能独立干活的 AI 智能体,在他看来就是 AGI 的预演。不过他也把话说得很清楚:AGI 不会突然蹦出来,而是一段持续加速的升级过程。他更担心的是,各国政府和社...

推荐理由:哈萨比斯这次把 AGI 时间线压到 2029-2030,比很多人的预期要快。他点出多模态和自主决策是硬指标,但正文没展开讲现在卡在哪、验证标准是什么,所以这个预测更像个人判断而非有数据支撑的路线图。我会先打个折:方向值得关注,但别当倒计时看。

r/LocalLLaMA

StepFun 3.7 Flash:196B 总参数、11B 激活的 MoE 模型,带 1.8B 视觉模块,能在 128GB 内存的本地机器上跑

StepFun 放出了 Step 3.7 Flash,一个混合专家(MoE)模型,总参数量 196B,但每次推理只激活 11B 参数,所以对算力要求没那么夸张。它内置了一个 1.8B 参数的视觉 Transformer(ViT),可以直接处理图像输入。官方说这个模型能在配备 128GB 内存的本地环境里运行,不用非得连云端。不过 Reddit 原帖被网...

推荐理由:StepFun 扔了个新模型,196B 参数但只激活 11B,还带了个 1.8B 的视觉模块,最抓眼球的是说能在 128GB 内存的机器上本地跑。我会先打个折:Reddit 上的信源比较散,授权协议、具体评测方法和能不能公开用都没说清楚,所以分数没给太高。但光凭这个规格和本地运行的承诺,对玩硬件和关注成本的人来说已经值得看一眼了。

AI HOT 精选

阶跃星辰开源 Step 3.7 Flash,198B 参数 MoE 模型,活跃参数约 11B,专为智能体工作流做效率优化

阶跃星辰放出了一个开源模型 Step 3.7 Flash,架构是 198B 参数的 MoE(混合专家),实际干活时只激活大约 11B 参数,所以跑起来相对轻量。上下文窗口给到 256K,能读图、读文档,也能直接生成代码或调用工具。它在 ClawEval-1.1 上拿了 67.1 分,SimpleVQA Search 上 79.2 分,这两个榜目前排第一...

推荐理由:这条发布的核心卖点是“大模型的身子,小模型的成本”,198B MoE 只激活 11B 参数,对想把模型塞进智能体流程的人吸引力很直接。256K 上下文和 ClawEval-1.1 的 67.1 分给了可查的硬数字,不是纯宣传。不过正文没提独立评测和实际延迟数据,这点先别太激动。整体信息量够、有记忆点,放在 featured 合适。

AI HOT 精选

Google 发布两款图像模型 Nano Banana Pro 和 Nano Banana 2,已接入 Gemini API 可用

Google AI 开发者账号官宣了两个图像模型:Nano Banana Pro(代号 gemini-3-pro-image)和 Nano Banana 2(代号 gemini-3.1-flash-image),现在就能通过 Gemini API 调用,直接上生产环境。帖子贴了一些社区示例展示效果,但正文没披露定价、跑分、并发限制这些关键信息,想评估成...

推荐理由:Google 这次一口气发了两个图像模型,Nano Banana Pro 和 Nano Banana 2,都走 Gemini API,直接面向生产环境。标题和摘要只给了名字和可用性,没提性能对比、价格、安全机制,所以没法判断实际强不强。我会先打个折,不往 p1 放,但作为产品动态值得让关注图像生成和多模态的人知道。

The Verge · AI

一部成本2000美元的AI电影将在翠贝卡电影节首映

翠贝卡电影节下月会首映一部75分钟的AI生成电影《Dreams of Violets》,讲的是伊朗政府大规模杀害抗议者的虚构故事,画面和人物全由AI生成。制作成本只花了2000美元,素材来自新闻报道、照片和目击者描述。电影由2019年离开伊朗的Koosha兄弟制作,哥哥Ash是制片公司Fountain 0的CEO,弟弟Pooya是联合创始人。正文没披露...

推荐理由:我会先打个折:这不是模型发布或平台更新,而是 AI 在电影制作上的一个应用案例,所以重要性给到 featured 的低段位。但 2000 美元拍出一部 75 分钟、能进翠贝卡的片子,这个数字本身就够抓眼球——它说明 AI 工具已经把长片制作的门槛拉到极低。文章没披露用了哪些具体模型、后期人工修了多少,这点先别太激动。不过,低成本加老牌影展的组合,对从业者来说,比单纯炫技更有冲击力,因为它直接摆出了“省钱”和“替代”这两个现实问题。

5月28日星期四

NVIDIA 博客

NVIDIA 在 ICRA 发了 8 篇论文,核心是让机器人在仿真里练完直接去现实世界干活

NVIDIA Research 在 ICRA 上展示了 8 篇论文,都围绕一个思路:在仿真里训练机器人,然后直接部署到真实环境。ScheduleStream 让多机械臂并行规划,速度提升 3 倍,代码已开源。COMPASS 导航框架完全不靠真实数据,在仿真里训练后迁移到真机,20 次真实导航测试成功率约 80%,比纯模仿学习基线高了 4.5 倍。Gra...

推荐理由:我会先打个折:这些成功率都是在论文设定的场景里跑出来的,换到更乱的现场不一定能复现。但 8 篇论文同时给出实机数据,而且不是零星的几次测试,ScheduleStream 的 3 倍提速和 COMPASS 的 20 次导航约 80% 成功,至少说明 sim-to-real 的 gap 在可控缩小。对正在纠结仿真训练能不能落地的团队,这组结果比纯讲架构有说服力。

r/LocalLLaMA

英伟达 LocateAnything:用并行框解码做视觉定位,号称比 Qwen3-VL 快 10 倍

英伟达放出了一个叫 LocateAnything-3B 的模型,专门做视觉语言定位——就是给张图、说句话,模型把对应物体用框标出来。它主打“并行框解码”,不像传统方法一个个框串行生成,所以速度上来了,标题直接写比 Qwen3-VL 快 10 倍。不过帖子正文只给了 Hugging Face、GitHub、Demo 和项目链接,没披露具体跑分设置和准确率...

推荐理由:我会先打个折:正文基本就是标题加三个链接,没有完整评测设置,也没给召回率、准确率这些质量指标,所以“快 10 倍”目前只能当官方说法看。但 Nvidia 开源一个 3B 的视觉定位模型,用并行框解码把速度拉起来,这件事本身对做实时视频分析、端侧部署的人挺实用。先放进 featured,等有第三方跑分再更新判断。

机器之心 · 公众号

ICML 2026:AutoMoT 用大小模型异步分工,在 Bench2Drive 和 nuScenes 上拿了双料第一

这篇文章本身被微信环境验证挡住了,正文内容没抓到,所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型,核心思路是把视觉语言模型和驾驶动作拆成两个专家:一个 4B 的 Qwen3-VL 负责看懂场景,一个 1.6B 的动作专家负责输出驾驶指令,而且两个模型是异步推理的,不用互相等。在...

推荐理由:我会先打个折:双 SOTA 听着唬人,但正文没披露 nuScenes 的具体指标,只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理,大模型负责想、小模型负责开,不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策,1.6B 的 AE 执行,这个组合在算力上挺省。不过论文没提实车验证,纯仿真成绩,这点先别太激动。整体看,对做自动驾驶算法的人有参考价值,但离出圈还差一口气,所以放在 featured 而不是更高一档。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。

AI HOT 精选

Hao AI Lab 开源 FastVideo Dreamverse,一张 B200 显卡 7 秒跑出 30 秒 1080p 视频

这个工具用一张 NVIDIA B200 GPU 搭配 LTX-2 模型,把生成 30 秒 1080p 视频的时间压到了 7 秒,做到了实时出片。代码和博客都公开了,但正文没披露画面质量、一致性和复杂场景下的表现,实际效果得自己跑一遍才知道。

推荐理由:我会先打个折:目前只有Hao AI Lab单方面放出的数据,没看到第三方跑分或横向对比,所以别急着当定论。但7秒出30秒1080p这个指标本身很直观,如果真能在单卡B200上稳定复现,对做实时视频生成的人来说省卡又省时间。正文没披露模型权重是否全开源、也没提长视频的连贯性测试,这两点会直接影响实际能用在哪。

5月27日星期三

AI HOT 精选

Runway 发布 MCP 服务器,让 Claude、ChatGPT 这类助手能直接在对话框里帮你生图和剪视频

Runway 推出了一个 MCP 服务器,相当于给 AI 助手装了个插件,让 Claude、ChatGPT、Cursor 等工具能在聊天窗口里直接调用 Runway 的模型生成图片和视频。你不用再切换软件,给助手扔一个商品链接、一张参考图或一段文字描述,它就能把成品返回到同一个对话框里。这次接入的模型包括 Gen-4.5、Seedance 2.0、GP...

推荐理由:这条消息的钩子很直接——Runway 的视频能力进了程序员和创作者天天用的对话工具。技术上不是模型突破,而是集成方式变了,MCP 服务器当中间人,让多个模型被一个入口调度。对从业者来说,这比单纯发个新模型更贴近实际工作流,所以 HKR 三项都成立。不过正文没提延迟、并发限制和计费方式,实际体验还得观望。整体算一次产品整合更新,重要性给 76 分,放在 featured 里合理。

TechCrunch · AI

YouTube 开始自动给 AI 视频打标签,不再全靠创作者自觉

YouTube 不再只靠创作者自己申报 AI 内容,现在会用内部系统自动检测并给“用了大量逼真 AI 画面”的视频打上标签。同时标签位置会更显眼,长视频和 Shorts 都适用。不过正文没披露这套自动检测的准确率、误判后怎么申诉、具体什么时候全面铺开,也没说对直播有没有用。

推荐理由:YouTube 不再只靠创作者自己勾选,而是平台主动识别并标注写实 AI 视频,标签也会更醒目。我会先打个折:正文没披露识别准确率、申诉机制和具体铺开范围,所以别急着把它当成完美方案。但这条更新本身是实打实的规则变化,对做视频生成和内容合规的人有直接参考价值。

量子位 · 公众号

7B小模型在医学影像理解上跑赢o3和GPT-5,靠的是教会模型“看哪里、怎么看”

上海创新研究院的LeapQuest和三所大学搞了两个医学AI系统Ophiuchus和MedScope,核心思路是让模型在看图看视频时学会像医生一样先定位关键区域再分析。Ophiuchus-7B在8个医学视觉问答基准上拿了68.0分,比OpenAI-o3的62.2、Gemini 2.5 Pro的61.8和GPT-5的59.9都高。正文没披露具体参数量以外...

推荐理由:我会先打个折:标题里 GPT-5 目前没公开评测数据,更像噱头,但 7B 模型在医学 VQA 上跑赢 o3 这个事实本身够抓人。正文给了 8 个 benchmark 的平均分对比,信息量撑得起 featured。不是通用大模型发布,分数定在 80 合理。

r/LocalLLaMA

PrismML 放出二值/三值 Bonsai Image 4B:1-bit 文生图扩散模型,浏览器里就能跑

PrismML 发布了 Bonsai Image 4B 的二值和三值版本,把文生图扩散 Transformer 的权重压到 1-bit 或三值,模型体积约 3GB。作为对比,FLUX.2 Klein 4B 大概要 16GB。Reddit 帖子里给了浏览器端 WebGPU 本地运行的 demo 链接,模型用 Apache-2.0 协议开源。不过帖子正文被...

推荐理由:PrismML 这个 Bonsai Image 4B 把文生图 DiT 压到 1-bit 和三值,模型约 3GB,能在浏览器 WebGPU 上完全本地跑,Apache-2.0 开源。我会先打个折:Reddit 信源、实验室发布,实际出图质量和速度还没第三方验证,这点先别太激动。但技术方向上,低比特量化做到浏览器可跑,对本地推理和隐私场景确实挺省钱,所以给 featured 低位。