跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 121–140 条 · 共 514 条

6月12日星期五

AI HOT 精选

MiniMax 开源 M3 模型:总参数 428B,激活 23B,上下文窗口拉到 100 万 token

MiniMax 把 M3 的权重传上了 HuggingFace,技术报告和完整权重大概还要等 10 天。这是个混合模型,总参数量 428B,但每次只激活 23B,靠 MiniMax 自研的稀疏注意力把上下文窗口撑到 100 万 token,还原生支持多模态。跑分方面:SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0...

推荐理由:MiniMax 第一次把旗舰模型权重开源,428B 的混合专家模型,激活 23B,百万 token 上下文,代码和智能体跑分能跟 DeepSeek、Qwen 掰手腕。技术报告还没出,权重刚上传,信息缺口明显,但开源这个动作本身对开发者生态有直接价值。

AI HOT 精选

WSJ:OpenAI 想靠大降价和超级应用改版,在 IPO 前抢企业开发者

WSJ 消息,OpenAI 正在考虑大幅降价,直接原因是 Anthropic 的 Claude Code 在企业开发团队里用得越来越多,token 消耗量很大,抢走了不少付费用户。OpenAI 虽然在大众用户里名气更大,但真正赚钱靠的是企业客户,所以这次降价主要冲着开发者来。同时,OpenAI 在筹备 IPO 前要对 ChatGPT 做一次最大规模的改...

推荐理由:WSJ 独家消息,OpenAI 正在考虑大幅降价,直接导火索是 Claude Code 在企业开发团队里 token 消耗量很大,抢了不少付费用户。OpenAI 虽然大众名气大,但真正赚钱靠企业客户,这次降价就是冲着开发者来的。同时,IPO 前还要对 ChatGPT 做一次最大规模改版。我会先打个折:正文没披露具体降价幅度和改版细节,但竞争态势确实在变,价格战信号很明确,对从业者选工具和算成本有直接影响。

6月11日星期四

AI HOT 精选

Runway 与狮门影业互相持股,将联合开发 AI 驱动的短剧新 IP

狮门影业买了 Runway 一部分股份,两家公司会一起开发新 IP,第一个项目是用狮门现有 IP 结合 Runway 视频生成模型做的短剧。狮门还会作为合作方参与 Runway 的 AI 电影节。Runway 的 CEO Cristóbal Valenzuela 说,真正重视 AI 的制片厂把它当创作资源,不是省钱工具。狮门是好莱坞第一家跟 AI 研究...

推荐理由:狮门影业入股 Runway 并合拍短剧,是好莱坞目前对 AI 视频生成最实打实的下注。Runway CEO 那句“当创作资源不是省钱工具”也把姿态摆得很明确。不过正文只披露了一个项目,没提制作规模、预算和观众反馈,所以分数没给更高——先看这部短剧出来什么样再说。

AI HOT 精选

小米开源终端编程助手 MiMo Code,MIT 协议,内置模型限时免费

小米把终端 AI 编程助手 MiMo Code 开源了,MIT 协议,随便用。内置的 MiMo-V2.5 多模态模型目前免费,性能自称对标 Claude Sonnet 4.6,但正文没写免费到什么时候,也没提参数量。它也支持接 DeepSeek、Kimi、GLM 这些外部模型。两个值得看的设计:一个是持久记忆系统,靠独立子 agent 自动存项目记忆、...

推荐理由:小米这次开源 MiMo Code,MIT 协议加免费模型,对开发者吸引力不小。我会先打个折:模型性能对标 Sonnet 4.6 的说法正文没给评测细节,参数量也没披露,免费能用到什么时候也不清楚,这些缺口让判断得收着点。真正值得看的是那个持久记忆子 agent,自动存项目记忆而不是简单翻聊天记录,工程思路比多数终端助手走得远。另外它支持接 DeepSeek、Kimi 这些外部模型,灵活性也加分。整体来说,开源动作本身比模型宣称更有信息量。

6月10日星期三

OpenAI News

OpenAI 封禁了一批疑似来自中国的 ChatGPT 账号,理由是它们在美国的 AI 政策讨论里搞隐蔽舆论操作

OpenAI 在 6 月 10 号发了份威胁报告,封了两组大概率来自中国的 ChatGPT 账号。一组叫“数据中心顺风车”,专门生成“AI 数据中心推高居民电费”的帖子和图片;另一组叫“科技与关税”,一边骂美国关税是打压科技竞争的手段,一边在提示词里要求只提特朗普、不提习近平。后一组还散布过“ChatGPT 用户数据泄露”的假消息,OpenAI 说这完...

推荐理由:OpenAI 官方威胁报告,有具体操作细节和账号集群,HKR 三个维度都踩实了。但本质是一次安全事件披露,不是产品/技术突破,所以放在 78 分这个“质量不错”的区间。没给更高是因为它没有重塑行业格局或技术路线。

AI 群聊日报

Anthropic 发布 Claude Fable 5/Mythos 5,编程跑分跳到 80.3%,但安全分类器误伤一片,连自家安全报告都封

Anthropic 一天扔出两款模型:Fable 5 给所有人用,满血版 Mythos 5 只给受信伙伴。SWE-bench Pro 得分 80.3%,比上一代 Opus 4.8 的 69.2% 和 GPT 5.5 的 58.6% 都高出一截,仅靠看屏幕截图就打通了宝可梦火红。定价是 Opus 4.8 的两倍,输入每百万 token 10 美元,输出 ...

推荐理由:Anthropic 旗舰模型发布,SWE-bench Pro 冲到 80.3%,远超 GPT 5.5 的 58.6%。定价翻倍但 Coding Plan 可能短期有成本优势。跨源信息确认,HKR 三个维度都打中了。扣 1 分是因为正文没披露 Mythos 5 的具体细节和开放计划,信息有缺口。

AI HOT 精选

Google Gemini 3.5 实时翻译开放公测,支持 70 多种语言、2000 个语言对

Google 把 Gemini 3.5 的实时翻译功能放出来了,现在通过 Gemini API 就能用。它做的是语音到语音的低延迟翻译,覆盖 70 多种语言,能组合出 2000 个语言对,冷门小语种也包含在内。开发者可以把它接进实时对话、客服、直播或跨国会议里。主推文提到这消息被 Anthropic Fable 5 的声量盖过去了,还顺带提了阿里 Qw...

推荐理由:HKR 三项都成立:Google 把实时语音翻译做成 API 公开预览,对开发者有直接吸引力,也给了语言覆盖和语言对的具体数字。但文章只提了功能开放,没写价格、延迟基准和可用区域,信息有缺口,所以重要性停在 78。

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。

AI HOT 精选

Claude Fable 5 和 Mythos 5 发布:编程最强、能打游戏,但安全限制会误拦 5% 的对话

Anthropic 发了两个新模型:Claude Fable 5 和 Claude Mythos 5。Fable 5 是面向普通用户的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只通过美国政府合作项目开放。Fable 5 在软件工程、知识工作和视觉任务上都是新标杆——Stripe 测试时,它一天干完了原本一个团队两个月的代码迁移活;在...

推荐理由:Anthropic 一次发了两个模型,Fable 5 是普通用户能用的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只走美国政府合作渠道。Fable 5 在软件工程、知识工作和视觉任务上都刷了新纪录——Stripe 拿它做代码迁移,一天干完原本一个团队两个月的活。药物设计速度也快了 10 倍,这个数字挺夸张,但正文没披露具体测试条件和对比基线,先打个折看。定价方面,Fable 5 每百万 token 输入 10 美元、输出 50 美元,比前代贵了不少,得算算性价比。整体看,这是一次 Claude 主线模型的实质性更新,有定价、有基准...

The Verge · AI

Anthropic 放出首个 Mythos 级模型 Claude Fable 5,之前因网络安全能力太强被扣着没发

Anthropic 发布了 Claude Fable 5,说这是他们迄今公开的最强模型。它在软件工程、知识类工作和视觉任务上表现突出,任务越长越复杂,领先优势越明显。Fable 5 是 Mythos 系列第一个大规模公开的模型,之前这个系列因为网络安全能力太强,公司觉得放出来太危险。这次能发,是因为加了新安全机制,会在特定高风险领域直接拦截回答。正文没...

推荐理由:Anthropic 把之前自己判定为太危险的 Mythos 系列第一次公开了,这件事本身就够大。Fable 5 在长任务软件工程上拉开的差距有具体数字,不是公关话术。新加的安全拦截器是它能公开的关键,但正文没细说拦截机制到底多可靠、会不会误伤,这点先别太激动。整体来看,这是今年模型发布里少数能同时炸到技术圈和安全圈的一次。

TechCrunch · AI

Anthropic 把最强模型 Mythos 砍掉危险能力后,以 Claude Fable 5 的名字向公众开放

Anthropic 第一次把自家最强的 Mythos 模型开放给普通人用,但加了一道硬锁:在网络安全、生物、化学和模型蒸馏(用大模型教小模型)这些高风险领域,Fable 5 会直接拒答,退回到更保守的 Claude Opus 4.8。这个模型擅长写代码、知识类工作和图像理解。今年四月 Mythos 刚露面时只给少数合作伙伴试用,原因就是怕被拿去搞网络攻...

推荐理由:Anthropic 把内部最强模型放出来给普通人用,本身就是产品层面的实质性动作,安全机制也说得够细。HKR 三条全中。没给更高分是因为正文没放跑分对比,也没提价格,实际能力和性价比还得等实测。

6月9日星期二

AI HOT 精选

Google 放出 Gemini 3.5 Live Translate,话没说完就开始翻,支持 70 多种语言

Google 发了 Gemini 3.5 Live Translate,一个实时语音转语音翻译模型。它不等对方把整句话讲完,边听边翻,用流式更新把结果推出来,延迟压到几秒,还能保留原声的语速、音高和语调。支持 70 多种语言,目前通过 Gemini Live API、Google Meet 预览版和 iOS/Android 的 Google 翻译 Ap...

推荐理由:HKR 三项都成立:Google 把实时语音翻译绑定了 70+ 语言和说话人未结束就开始的流式输出。分数留在 82,因为正文没披露具体上线范围、定价和基准测试结果,实际效果和可用性还得等验证。

AI HOT 精选

Gemma 4 12B 发布:一个模型直接看懂图文和音频,不用外挂编码器

Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...

推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。

AI HOT 精选

一位开发者用 GPT-5.5 替代 OCR 流程,把 2.3 万篇 ChinaRxiv 论文免费开放并配上更完整的英文翻译

这件事的起点很简单:有人觉得传统的 OCR(光学字符识别)管道太复杂,直接用 GPT-5.5 来读论文、做翻译,结果把 23,000 多篇 ChinaRxiv 上的论文免费放出来了,还带了比之前更完整的英文翻译。正文没披露具体成本、延迟和翻译质量对比,所以没法判断这套方案在准确率和开销上到底比 OCR 好多少。如果是真的省钱又省事,对需要批量处理中文论...

推荐理由:我会先打个折:这不是 OpenAI 官方模型发布,而是一个开发者用例,所以推荐分在 78–84 这个区间。HKR 三项都踩中了——用 GPT-5.5 砍掉 OCR 管道是个很具体的钩子,23,000+ 篇论文的规模也给了实感,对做文档处理和研究的人确实有用。但正文没披露成本、延迟和翻译质量对比,这点先别太激动,没法判断准确率和开销到底比 OCR 好多少。如果是真的省钱又省事,那对批量处理中文论文的场景挺有参考价值。

AI HOT 精选

腾讯混元开源 UniRL:一套强化学习框架同时管图像生成和语言模型,还带了两个新算法

UniRL 把扩散模型、流匹配模型、大语言模型和视觉语言模型的强化学习训练塞进了同一个后训练循环里,流程就是生成、打分、算优势、更新参数再同步。框架把模型和算法拆成两个独立维度,可以自由组合,目前已经用在 Hunyuan-Image 3 和 Bagel 上。这次一并开源了两个算法:Flow-DPPO 给流/扩散模型加了基于精确散度的信任域约束,训练更稳...

推荐理由:UniRL 不是新模型发布,而是一个多模态强化学习的训练框架,把扩散、流匹配、LLM 和 VLM 的 RL 训练流程统一了。框架设计上把模型和算法解耦,搭配开源的两个算法(Flow-DPPO 和 DRPO),对做多模态对齐和微调的从业者来说,省了自己搭轮子的功夫。信息量够、开源动作实在,但属于基础设施层发布,不是旗舰模型,所以重要性给到 81,放在 featured 位置。

AI HOT 精选

一个编程 Agent 串起两个 HuggingFace Space,自动生成了一个巴黎地标 3D 画廊

作者让一个编程 agent 自己动手,把 ideogram-ai/ideogram4 和 VAST-AI/TripoSplat 这两个 Space 串了起来。流程是:先用 ideogram4 生成巴黎地标的图片,再把图片喂给 TripoSplat,从单张图片重建出 3D 高斯泼溅文件(.ply),接着转成体积小约 3 倍的 .ksplat 格式,最后用...

推荐理由:我会先打个折:这不是模型或平台发布,而是一篇 Hugging Face Spaces 的实操教程。但作者把两个现成 Space 串起来,让 agent 自己跑通从文字到 3D 场景的流程,还给出了约 3 倍的压缩数据,对做 agent 编排和轻量 3D 管线的人挺实用。正文没披露生成质量和延迟的具体测试,这点先别太激动。整体放在 featured 档位合适。

6月8日星期一

AI HOT 精选

Runway 发布 Aleph 2.0 视频编辑模型,上传视频后一键改横竖比例

Runway 在桌面网页版上线了 Aleph 2.0 编辑模型。你上传一段已有的视频,选一个想要的宽高比,模型会自动把多出来的画面区域补上,让视频看起来就像原本是按这个比例拍的。正文没披露生成分辨率、处理时长和收费方式,实际效果得自己试。

推荐理由:Runway Aleph 2.0 是个中等体量的视频产品更新,机制讲得清楚,但没给定价、画质评测和铺开范围。HKR 三项都踩中了,放在 featured 门槛的低位。我会先打个折:正文没披露生成分辨率、处理时长和收费方式,实际省不省时间、效果自不自然,得自己上手试。

AI HOT 精选

微软AI负责人说超级智能快来了,但不会抢你饭碗

Mustafa Suleyman 在播客里聊了几个事。他判断超级智能不会造成大规模失业,但没给出具体论证。微软去年10月跟 OpenAI 签了新合同,一边继续合作,一边拿到了独立研发超级智能的许可,已经建了团队、在训前沿模型,本周 Build 大会还发了7个全模态模型。他点名批评 Anthropic 把 Claude 说成有意识,认为现在消费者对 AI...

推荐理由:Mustafa Suleyman 在播客里抛了个大判断——超级智能不会造成大规模失业,但正文没给出具体论证,这点先别太激动。信息量主要靠两个事实撑着:一是微软去年10月跟OpenAI签的新合同,既续了合作又拿到了独立研发超级智能的许可,团队和前沿模型训练都已经在跑了;二是本周Build大会发了7个全模态模型。他还点名批评Anthropic把Claude说成有意识,认为现在消费者对AI的理解还太浅。整体是CEO访谈,不是产品发布,所以分数卡在78-84这个区间。

r/LocalLLaMA

有人盯着我的检测 API 打了半年对抗攻击,这三种套路最常得手

Bordair 的作者把检测 API 挂了六个月,从真实流量里抓出三类反复出现的攻击模式:多轮铺垫、利用对话惯性往前推、以及直接给模型换人设。上个月公开的对抗游戏里大概产生了 6700 次攻击,说明这些手法不是实验室玩具,已经在线上跑了。正文没披露具体绕过率和误报率,这点先别太激动。

推荐理由:这篇文章来自一线实战,不是纸上谈兵。作者把检测 API 暴露在真实流量里半年,抓出多轮铺垫、对话惯性推进、换人设三类攻击模式,上个月对抗游戏里还产生了约 6700 次攻击,说明这些手法已经在线上跑了。对做安全检测的从业者来说,这些实战经验比 benchmark 更有参考价值。不过正文没披露具体绕过率和误报率,效果到底怎么样还得打个问号,所以分数没给更高。

AI HOT 精选

高德发布 ABot-Earth0.5,用一张卫星图 10 分钟就能生成 3D 城市

高德搞了个叫 ABot-Earth0.5 的模型,号称是全球第一个原生 3D 的城市世界模型。它已经覆盖了 190 多个国家和地区。用起来很简单,你扔给它一张卫星图或者一段文字描述,它就能在普通消费级显卡上,大概 10 分钟给你生成一大片公里级的 3D 城市场景。出来的素材是 3DGS 格式,能直接拖进 Unity、虚幻引擎这些软件里接着用。按他们算的...

推荐理由:高德这个ABot-Earth0.5把3D城市生成的门槛压得很低:消费级显卡、10分钟、公里级、直接出可编辑资产。我会先打个折,正文没披露生成精度和几何一致性有多高,也没给实际案例对比,所以“全球首个原生3D城市世界模型”这个说法先别太激动。但即便只做到七八成,对需要大量3D场景的团队来说也挺省钱。H/K/R三条都踩实了,重要性给80合理。