跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 461–480 条 · 共 514 条

2月26日星期四

纽约时报中文网

美国在 AI 上“输”给中国的不是模型,是工厂

这篇文章的核心判断是:中国把 AI 用进了工厂车间,美国还在把 AI 当实验室项目。中国已建成 3 万多家智能工厂,2024 年全球新装的工业机器人超过一半进了中国工厂。极氪宁波工厂用了 800 多台机器人,小米北京工厂每 76 秒就能产一辆车,美的荆州工厂用 AI 把产线响应时间从几小时压到几秒。这些 AI 不是写诗画画,而是做视觉质检、生产调度和预...

推荐理由:这篇不是讲模型,是讲工厂里机器人、调度和质检的落地差距。我会先打个折:正文没披露3万多家智能工厂的具体认定标准,也没说美国18%这个数字的样本来源,所以数据力度要留个心眼。但极氪800多台机器人、小米76秒节拍这些车间数字是实的,对比美国三分之二试点推不向量产,差距感很直观。对看产线落地的人,这篇比模型跑分更有参考价值。

2月14日星期六

MIT Technology Review · AI

渐冻症夺走了这位音乐人的声音,AI 让他重新站上舞台唱歌

32 岁的 Patrick Darling 在确诊渐冻症两年后,用 AI 克隆了自己的歌声,2 月 11 日在伦敦重新和乐队一起演出。他的声音克隆不是用录音棚素材做的,而是从嘈杂的手机视频和厨房录音里拼出来的,ElevenLabs 的音乐工具花了大约六周调校。这件事的信号不在感人,在于门槛:ElevenLabs 把工具免费开放给因渐冻症等疾病失声的人,...

推荐理由:我会先打个折:这不是模型或产品大更新,而是一个应用案例。但案例本身够硬——ALS 患者用旧录音唱歌,不是概念演示,是真实上台。正文给了两个关键条件:10 分钟清晰语音和 6 周从噪音片段里抠出歌声,说明门槛和代价。ElevenLabs 把这个流程做成免费项目,但正文没披露底层模型细节,这点先别太激动。整体看,故事性强、有可复现信息、踩中声音权利话题,适合放低 featured。

2月13日星期五

OpenAI News

OpenAI 给 Codex 和 Sora 换了一套“先用额度,超了再扣钱”的访问系统

OpenAI 发了一篇工程博文,解释他们怎么解决 Codex 和 Sora 用户老撞速率限制的问题。核心做法是自研了一套实时访问引擎,把速率限制和预购点数揉在一起:请求先走免费速率额度,额度用完了自动从点数余额里扣,用户不用切换系统。文章说这套“决策瀑布”模型能在一个请求里同步完成判断,点数扣减异步处理,并且有三套独立数据(产品用量、计费事件、余额变动...

推荐理由:这是 OpenAI 官方的产品更新,标题抛出了“超越速率限制”这个钩子,对开发者来说很抓眼球,所以 H 和 R 都成立。但正文完全没披露具体怎么调、调多少、谁受益、花多少钱、什么时候上,信息密度极低,K 不成立。我会先打个折,把它放在 featured 底线,等后续有参数再重新评估。

2月12日星期四

MIT Technology Review · AI

AI 让线上诈骗更容易了,而且可能还会更糟

微软说截至 2025 年 4 月的一年里,他们拦下了 40 亿美元的诈骗和欺诈交易,其中很多可能靠 AI 生成内容帮忙。研究人员估计现在至少一半的垃圾邮件是用大语言模型写的,用大模型搞针对性邮件攻击的比例也从 2024 年 4 月的 7.6% 涨到了 2025 年 4 月的 14%。先别急着脑补“全自动 AI 黑客”,眼下真正的问题是 AI 把钓鱼、换...

推荐理由:这篇不是那种“全自动 AI 黑客来了”的标题党,它把焦点拉回到已经发生的事:钓鱼邮件、深伪、恶意代码生成,AI 在降低犯罪成本。数字有,但正文没披露这些攻击的总体增幅,所以判断要收着点。适合放进精选,因为它是一份有数据支撑的趋势报告,不是当天炸出来的事件或产品发布。

2月10日星期二

36 氪 · 直链

阿里千问发布 Qwen-Image-2.0,一个图像生成基础模型,已开放 API 邀测

千问推出了新一代图像生成基础模型 Qwen-Image-2.0。现在可以在阿里云百炼上申请 API 测试,也能在 Qwen Chat 上免费试用。不过正文没披露模型参数量、具体定价、评测跑分和正式公开时间,所以实际效果和成本还不好判断。

推荐理由:千问发了个新的图像生成基础模型,百炼 API 邀测和 Qwen Chat 免费体验都开了,HKR 三项全中:有实际可用的产品信号、有明确的接入路径、对国内模型用户有直接参考价值。没给到 78 分以上是因为正文缺了模型大小、价格这些关键信息,我会先打个折。

2月3日星期二

MIT Technology Review · AI

我们一直搞错了 AI 的真相危机:就算知道是假的,人还是会信

MIT Technology Review 的这篇文章直接点出一个反直觉的发现:我们过去对 AI 造假危机的想象,可能全偏了。作者拿自己上周的报道举例——美国国土安全部首次被确认在用 Google 和 Adobe 的 AI 视频工具做面向公众的宣传内容,配合特朗普政府的移民执法造势。文章指出,我们原本指望靠 Adobe 的“内容真实性倡议”这类标签工具...

推荐理由:这篇不是空对空的评论。它先拿国土安全部用 Google 和 Adobe 视频生成器做公开内容这件事当引子,然后拆了两个标签系统的实际漏洞,最后用 Communications Psychology 的论文把问题钉死:受试者明知认罪视频是 deepfake,还是会据此判断有罪。信息链条完整,判断都挂在事实和论文上,没有补设定。我会先打个折,因为它本质还是评论加一篇论文,不是当天能震动行业的硬事件,但对正在搭安全流程的团队来说,这篇值得一看。

1月31日星期六

MIT Technology Review · AI

斯坦福和印第安纳大学的研究发现,AI 模型平台 Civitai 上 90% 的定制深度伪造悬赏都针对真实女性

斯坦福和印第安纳大学的研究人员扒了 Civitai 这个 AI 内容交易平台的数据,发现从 2023 年中到 2024 年底,平台上 90% 的深度伪造悬赏(bounties)都指名要生成真实女性的假照片。这些悬赏主要求购一种叫 LoRA 的指令文件——你可以把它理解成给 Stable Diffusion 这类主流生图模型用的“风格补丁”,能让模型画出...

推荐理由:这篇调查把 Civitai 上的深伪滥用做成了一个看得见的市场账本。我会先打个折:数据只覆盖到 2024 年底,平台 2025 年 5 月才全面封禁,时效性上不是最新变动,但那些硬数字——90% 针对女性、86% 要定制 LoRA、单笔几美元、九成多已结单——把“需求有多集中、门槛有多低”讲得很清楚。对从业者来说,值得盯的不是个案,是平台把生成教程、支付和撮合串成一条流水线,封禁后旧货还在流通,这比单纯托管内容麻烦得多。正文没披露 Civitai 或投资方 a16z 的回应,也没给出封禁后的下架率,所以判断先停在“治理缺口明显”这一步。

1月30日星期五

MIT Technology Review · AI

美国国土安全部用上了 Google Veo 3 和 Adobe Firefly 做视频

一份 DHS 公开的 AI 工具清单显示,他们正在用 Google Veo 3(视频生成)、Google Flow(整合了 Veo 3 的剪辑工具)和 Adobe Firefly 来制作和编辑对外发布的视频内容,估计有 100 到 1000 个使用许可。这算是第一次有书面证据表明,移民执法部门在社交媒体上发的那些看着像 AI 做的视频,背后可能用的就是...

推荐理由:这条消息的冲击力在于,一个联邦机构已经不只是内部试用,而是把生成视频工具写进了对外内容制作的流程里。100 到 1000 份许可的估算说明规模不小,但正文没披露具体项目、发布时间或单条视频归属,所以实际落地到什么程度还看不清。我会先打个折,不把它推到更高等级,因为缺少可验证的产出案例。真正值得盯的是跨平台水印和内容溯源目前没法验证,这点先别太激动,但确实是个持续的风险敞口。

彭博科技

苹果收购以色列 AI 初创公司 Q.ai,技术能读懂面部动作和无声交流

苹果买下了一家叫 Q.ai 的以色列公司,他们做的技术是通过分析面部肌肉的细微动作来理解人在说什么——哪怕不出声。收购价格、团队规模和具体会用在苹果哪款产品上,正文都没披露。我会先打个折:目前能看到的只是彭博社的摘要片段,原文被付费墙挡了,所以细节有限。从已知信息推测,这项能力最可能被塞进辅助功能(比如帮语言障碍者沟通)、AirPods 的交互,或者 ...

推荐理由:Bloomberg 的信源给了这条消息 featured 的底气:苹果买无声交流视觉技术,话题性和关联度都够。但正文没给交易金额、团队规模和集成路线图,所以知识密度偏弱。我会先打个折,等后续有产品落地细节再往上调。

1月29日星期四

阮一峰的网络日志

Kimi 把模型和智能体绑在一起发,Manus 则靠别人的模型做上层应用

Kimi 这次发布的重点不是 K2.5 模型本身,而是它同时推出了一个基于该模型的智能体应用,直接在官网上线了。这跟 Manus 的做法正好相反:Manus 用的是 Anthropic 的 Claude 模型,自己只做上层的智能体产品,属于分层开发。Kimi 走一体化路线,把底层模型和上层应用打包发布。文章实测了 K2.5 智能体的“视觉编程”功能,上...

推荐理由:这篇值得看,因为它讲的是产品形态的转向,而不只是模型跑分。Kimi 这次把 K2.5 模型和 Agent 模式一起塞进官网切换入口,等于告诉用户“你不用管底下是什么,直接用就行”。1500 步操作和 100 个 Agent 并发的数字,说明他们在长任务和并发上做了工程投入;视觉编程那条路,是从设计稿或录屏直接出页面,想法挺直接。但我会先打个折:正文没写价格、上下文长度和 API 条件,这些才是工程落地的硬指标。另外消息源本身是评论性质,不是一手技术报告,所以判断要留余地。整体来说,它把“一体化还是分层”这个老问题又拉回台面上,对做 Agent 产品...

1月20日星期二

MIT Technology Review · AI

英国政府掏钱,让 AI 自己设计实验、自己跑流程

英国高级研究与发明署(ARIA)从 245 份提案里挑了 12 个项目,给每个团队约 50 万英镑(大概 67.5 万美元),让他们在九个月内做出能独立跑通“提假设—做实验—分析结果—再迭代”这套完整科研闭环的 AI 系统。ARIA 管这叫“AI 科学家”,说白了就是让大模型调用现有工具去干活,人类只负责定方向和监督。这次资助金额比 ARIA 平时给的...

推荐理由:英国 ARIA 这次不是撒概念,是真金白银选了 12 个团队做“AI 科学家”——系统要能自己提假设、设计实验、跑实验、分析结果再循环迭代。我会先打个折:目前获资助的项目主要还是调用现成工具,离全自动实验室还远。正文引了一项外部研究,说大模型代理跑完整科学流程的失败率有 75%,这点先别太激动。真正值得盯的是有没有团队做出可复现的实验闭环,而不是新闻稿里的热度。

1月16日星期五

阮一峰的网络日志

中国 AI 大模型领导者在想什么

阮一峰记录了1月10日北京一场闭门会上几位大模型负责人的发言。智谱唐杰说,对话式AI的范式基本到头了,下一步是让模型真正做事,他们把编程、智能体和推理能力整合在一起。阿里林俊旸坦言,美国可用的算力比国内大一到两个数量级,人家拿算力搞下一代研究,我们光交付就占掉绝大部分资源;他判断三到五年后全球最领先的AI公司是中国团队的概率只有20%。腾讯姚顺雨观察到...

推荐理由:这篇周刊摘录了一场闭门峰会的发言,把智谱、阿里 Qwen 和腾讯 AI 负责人对中国大模型路线的判断摆在一起。我会先打个折:它不是一手发布,是二手整理,所以分数没往更高走。但它的好处是给了具体数字和分歧点——唐杰押注 2025 年是 RLVR 爆发年,林俊旸押多模态基础智能体,姚顺雨强调企业愿意为强模型付 200 美元月费,林俊旸还给出中国团队 20% 概率诞生全球最领先 AI 公司。这些判断有可验证的时效,不是公关口径,对从业者判断方向有参考价值。

1月13日星期二

MIT Technology Review · AI

CES 2026 逛完,我理解了为什么中国科技公司这么乐观

今年 CES 来了超过 14.8 万人、4100 多家参展商,中国公司占了将近四分之一,在 AI 硬件和机器人区域尤其扎堆。作者临时决定去现场,结果发现中国厂商已经不只是“便宜量大”的路子——家用清洁机器人在美国市场把 Dyson 和 Shark 的份额抢得很凶,庭院设备也大多来自深圳,外观做得让人看不出是中国品牌。人形机器人展台围满了人,宇树甚至搭了...

推荐理由:这篇是 CES 现场观察,核心判断是:中国科技公司的乐观来自制造和供应链的迭代速度,不是单点技术突破。文章用 14.8 万参会者、4100 多家参展商、中国展商近四分之一这些数字撑住了场面感,也把联想 Qira、Nvidia Vera Rubin、AMD Helios 这些产品拉出来,说明竞争焦点正转向云端和混合 AI。我会先打个折:正文没给出货量、营收或订单数据,所以判断还停在趋势信号层面,但作为行业风向标,这篇值得一看。

1月12日星期一

36 氪 · 直链

何小鹏放话:未来顶尖 AI 公司都得自己造芯片,小鹏四款新车全换自研图灵芯片

何小鹏在 2026 年 1 月 8 日的新车发布会上说,未来最好的 AI 公司都会选择自己定制芯片,这决定了 AI 产品的性能上限。小鹏当天发布的四款新车全部用上了自研的图灵 AI 芯片,其中 Ultra SE 和 Ultra 版本还搭载了第二代 VLA 模型(视觉-语言-动作模型,让车能像人一样理解路况并做出驾驶决策),号称能实现初阶 L4 级辅助驾...

推荐理由:这篇不是空喊口号,而是用4款车、三档芯片配置和欧洲路测把路线图摊开了。我会先打个折:这还只是规划披露,不是已量产交付的事实,所以放在featured里偏保守的那一端。真正值得盯的是“自研芯片+自研模型+自建部署”这条链条,它把性能天花板从供应商手里拿回来了,对行业比单一产品发布更有长期影响。

1月6日星期二

NVIDIA 博客

NVIDIA 用 RTX 显卡在本地跑 4K AI 视频生成,显存占用降了 60%

NVIDIA 在 CES 上放出了一套本地 AI 视频生成方案,核心是开源模型 LTX-2 和升级版 ComfyUI。在 GeForce RTX 显卡上,生成速度比之前快 3 倍,显存占用最多能降 60%。这主要靠 PyTorch-CUDA 的底层优化,以及 ComfyUI 原生支持了 NVFP4/FP8 低精度计算。下个月还会推一个 RTX Vide...

推荐理由:我会先打个折:这是厂商博客发的生态优化更新,不是新模型发布或平台级变动,所以重要性停在 76 不动。但 HKR 三项都站得住——提速降显存的数据够具体,技术路径也交代清楚了,对玩本地 ComfyUI 的人来说是实打实的好消息。正文没提 LTX-2 模型本身的画质对比,这点先别太激动,等实测。

NVIDIA 博客

NVIDIA 一口气开源了一堆模型、数据和工具,覆盖智能体、机器人、自动驾驶和生物医药

NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...

推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...

1月4日星期日

36 氪 · 直链

华为云具身机器人负责人朱森华离职创业,用脑认知机制给机器人VLA模型打补丁

华为云AI算法创新Lab前主任朱森华2025年10月离职,创办了具身大脑公司“具脑磐石”,两个月内拿到数千万元种子轮融资,投资方包括乐聚机器人等。朱森华是脑神经科学博士后出身,团队想做的是用脑认知启发的方式改造现有的具身智能VLA模型——相当于给机器人视觉-语言-动作模型加一套算法“外挂”,模仿人脑的抽象概念学习和选择性注意力机制,目标是减少对海量数据...

推荐理由:这条值得放进精选。前华为云具身负责人出来单干,拿了数千万种子轮,故事本身就有信息量。公司说用脑认知的思路改VLA,原型数据挺好看:部署效率+40%,数据需求-90%。我会先打个折,因为全是公司自报,没有公开基准测试、客户数或规模化部署数据。正文没披露具体技术细节和验证规模,这点先别太激动。但它的商业路径说得清楚——先做外挂、先打亚太商服和工业场景,海外客户甚至接受只替代50%-70%人力,这个务实程度在具身智能创业里不多见。

2025年12月17日星期三

Mistral AI

Mistral 发布 OCR 3,表单与手写识别升级并接入 Document AI Playground

Mistral 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称准确率超过企业文档处理方案和 AI 原生 OCR 方案。

推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元的定价,可供评估文档解析方案时参考。

2025年12月16日星期二

OpenAI News

OpenAI 发了新版 ChatGPT 图片生成,说是更快、编辑更听话

OpenAI 在 12 月 16 日上线了新版 ChatGPT 图片功能,底层换了一个新的主力生图模型,API 里叫 GPT Image 1.5。官方说生成速度比之前快 4 倍,编辑图片时能更精准地只改你要求的部分,保留原图的光线、构图和人脸一致性。这次还加了一个独立的图片创作入口,内置了一些预设风格,不用写提示词也能玩。正文没披露具体画质指标、免费用...

推荐理由:OpenAI 官方发了个上线帖,所以 H 和 R 都成立:新图片功能是真实的产品事件,从业者肯定会讨论。K 不成立是因为正文没披露任何关键参数,连一张效果图都没有,信息量撑不起深度解读,所以保持在 featured 门槛附近。

2025年12月11日星期四

OpenAI News

迪士尼和 OpenAI 签了三年协议,要把 200 多个角色放进 Sora 和 ChatGPT 图片生成里

OpenAI 官方发了一篇公告,宣布迪士尼成为 Sora 的第一个大型内容授权方。协议为期三年,Sora 和 ChatGPT 图片生成功能会拿到超过 200 个迪士尼、漫威、皮克斯和星球大战的角色授权,包括米奇、艾莎、钢铁侠、尤达等,但不含真人演员的脸或声音。用户可以用这些角色生成短视频和图片,部分视频还会被选进 Disney+ 里播放。迪士尼同时会成...

推荐理由:这条消息我会先打个折——目前只有标题,正文是空的,所以能聊的其实不多。但“迪士尼角色进 Sora”这个组合本身就够有话题性:一方面它天然吸引点击,另一方面大 IP 直接接入视频生成模型,版权怎么谈的、合规怎么过、会不会变成内容军备竞赛,都是从业者会立刻想到的问题。信息缺口很明显,角色范围、上线时间、授权条件全都没披露,所以现在只能把它当做一个信号,别急着下结论。