跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 61–80 条 · 共 514 条

8月3日星期一

Computing Life · Share · 鸭哥调研

Google Earth 上线 AI 生图一天就撤下:界面承诺的信用,比水印跑得更远

2026 年 7 月 30 日,Google 在 Google Earth 里加了一个 AI 生成按钮,让用户能在真实卫星底图上用 Nano Banana 2 模型合成假想图,结果一天之内就紧急撤回了。问题出在截图分享上:用户把生成的假图截屏发到社交平台后,图片上的 AI 水印和元数据在转码压缩中基本丢光,但 Google Earth 二十年来作为“现...

推荐理由:Google Earth 加了个 AI 生图按钮,一天就撤,这事有反转、有细节,还有用户实测绕过审核的案例,三个维度都踩中了。没给更高分是因为这是一篇观点分析,不是官方产品发布,撤回动作本身也说明 Google 自己没准备好。

8月1日星期六

Hacker News 首页

探索式建模:给模型 K 次猜测机会,只拿最好的那次来训练

Alexi Gladstone 提出了探索式建模(XM),核心思路很简单:每一步让模型生成 K 个候选结果,然后只拿最好的那个来训练。这相当于在数据和参数量之外,给预训练增加了第三条可以扩展的轴。实验显示,增加探索次数能稳定提升图像、视频和语言模型的效果,而且模型规模越大,收益越明显——数据量增加时,提升从 7% 涨到 36%;参数量增加时,从 13%...

推荐理由:Alexi Gladstone 提了个叫探索式建模(XM)的方法,做法很直白:每一步让模型吐出 K 个候选结果,只挑最好的那个拿来训练。这相当于在堆数据和堆参数之外,给预训练多开了一个可以拧的旋钮。实验跨了图像、视频和语言模型,效果都稳得住,而且模型越大、数据越多,收益越明显——数据量上去后提升从 7% 蹿到 36%,参数量上去后从 13% 涨到 23%,还报了个 6.2 倍的效率提升。我会先打个折,因为作者是个人研究者,不是知名实验室,文章也是自述形式,没有经过同行评审,这点先别太激动。但思路本身够简单,有代码有项目页,值得认真看一眼。

FT · 科技

Google Earth 上线没几天的 AI 卫星图功能被紧急下架,因为它会凭空捏造建筑和道路

Google 在 7 月 31 日关掉了 Google Earth 里刚推出几天的“AI 卫星视图”。这个功能本意是用生成式 AI 把模糊的卫星照片变清晰,结果用户发现它会在真实地形上自己“脑补”出建筑、道路和车辆。Google 确认该功能“没达到质量标准”,已经下线,但没说具体是什么条件触发了模型胡编乱造,也没给修复时间。对地图这种必须讲事实的产品来...

推荐理由:这条新闻本身够硬:Google 旗舰产品翻车,FT 独家,有具体例子,不是通稿。我会先打个折,因为正文没披露模型在什么条件下开始胡编,也没给修复时间,信息缺口明显,所以重要性卡在 78 合理。三个推荐理由都成立:热点事件、技术教训、从业者共鸣,直接写出来就行。

TechCrunch · AI

Google 上线一天就砍掉 Earth AI 生图功能,BBC 记者当场演示它能造假新闻

Google 周四在 Google Earth 里接入了 Nano Banana 2 生图模型,让用户输入文字就能在真实卫星地图上叠加任意 AI 生成的图像。BBC 记者立刻发帖嘲讽,说这个功能简直是给假新闻配图的利器,并当场生成了几张看起来很真的灾难现场图。Google 周五就宣布撤回该功能,承认部分用户生成的截图违反了平台政策,需要在加入更强的防护...

推荐理由:我会先打个折:目前只有 BBC 记者一方的公开测试和报道,Google 的回应也比较简短,具体防护机制和违规比例都没披露。但这事本身够直接——Google 把 Nano Banana 2 塞进 Google Earth,让用户输入文字就能在真实卫星图上叠加任意 AI 图像,BBC 记者立刻生成几张逼真的灾难现场图,Google 第二天就撤了功能。对从业者来说,这比实验室里的红队测试更有说服力,因为它发生在亿级用户产品上,而且暴露的不是模型能力问题,是产品集成时根本没拦住显而易见的滥用。所以给 82 分,没再高是因为信息源单一,且撤回动作本身也算止损。

The Verge · AI

Google 地球里塞了个 AI 生图工具,已经能造出以假乱真的卫星照片了

Google 地球新出的“Dream House”功能,本意是让你用文字生成航拍风格的房屋图片。但安全研究员 Henk van Ess 发现,只要在提示词里加上“卫星视图”,就能绕过内容过滤器,生成非常逼真的假卫星图。Google 虽然加了水印和限制,但把关键词换成“航拍视图”照样能出图。更麻烦的是,这些假图被反向图片搜索收录后,会出现在第三方地图数据...

推荐理由:这事最麻烦的不是能生成假图,而是假图已经流出去了。研究员用一句提示词就绕过了 Google 的内容过滤器,生成的假卫星图被反向图片搜索收录后,直接出现在第三方地图数据里。Google 加了水印,但把关键词从“卫星视图”换成“航拍视图”照样出图,说明过滤机制没卡住语义。正文没披露 Google 后续会不会清理已收录的假图,这点先别太激动,但数据污染的链条已经跑通了。

7月30日星期四

The Verge · AI

xAI 赶在明尼苏达州反“一键脱衣”法生效前起诉,称 Grok 生成露骨图片是言论自由

明尼苏达州一项禁止用 AI 生成未经同意的假裸照的法律马上要生效,xAI 在最后一刻提起了诉讼。xAI 认为这条法律写得太宽泛,会连带限制 Grok 的图像生成功能,违反了第一修正案对言论自由的保护。在法庭文件里,xAI 把 Grok 描述成一个“有态度、爱讽刺”的 AI 助手,说它生成的露骨图片是一种表达形式。州总检察长反驳说,法律只针对未经同意的伪...

推荐理由:xAI 起诉明尼苏达州的反 AI 假裸照法,把 Grok 的图像生成能力绑上第一修正案的言论自由辩护,法律冲突很尖锐。分数没给更高是因为目前只是一纸诉状,法院还没判,实际影响要等后续进展。

7月29日星期三

The Verge · AI

艺术家们开始集体起诉 AI 公司,部分案件已熬过第一轮驳回动议

插画师、作家和音乐人正在对 Google、Meta、Anthropic 等公司提起版权诉讼。文章追踪了最近的案件进展:一些法院驳回了科技公司要求撤诉的动议,让官司得以继续推进。艺术家们对胜诉的信心比之前高了一些,但对 AI 的整体走向仍然悲观。正文没披露具体的赔偿金额或和解细节。

推荐理由:一篇版权诉讼进展的汇总,亮点在于法院驳回了科技公司撤诉的动议,让案子能继续打。艺术家信心涨了一点,但对 AI 整体走向还是悲观。我会先打个折:正文没给赔偿数字或和解细节,所以只能当趋势信号看,别当深度法律分析。

7月28日星期二

Hacker News 首页

Kimi K3 架构解读:2.8 万亿参数开源模型,全身都是为推理省钱的改造

Sebastian Raschka 拆解了刚发布的 Kimi K3 架构。这个 2.8 万亿参数的开源模型是从去年 48B 的 Kimi Linear 放大来的,目前是最大的开源权重模型。设计上几乎全在给推理阶段省成本:用 LatentMoE 把大线性层压缩起来,类似给模型瘦身;标准注意力换成了多头潜在注意力和 Kimi Delta 注意力;还把 Ro...

推荐理由:Raschka 把 Kimi K3 的架构拆得很细,重点全在推理阶段怎么省钱:用 LatentMoE 压缩大线性层、换掉标准注意力、还改了 RoPE 的用法。不是官方通稿,是工程师视角的解读,对实际干活的人参考价值大。没给更高分是因为这是第三方技术分析而非一手发布,部分读者可能觉得太硬。

The Verge · AI

Hugging Face 上架了一堆“一键脱衣”模型,专挑女性和儿童下手

The Verge 的调查发现,Hugging Face 托管了大量能生成裸照的模型,很多伪装成“换装”或“时尚编辑”工具,只需要一张照片就能输出裸体图像,目标直指女性和儿童。平台目前几乎没有系统级防护,也不会主动扫描上传的模型。Hugging Face 说自己靠人工审核举报,但正文没披露审核团队规模和响应时间。我会先打个折——平台确实有内容政策,但执...

推荐理由:The Verge 的调查揭露 Hugging Face 托管了大量能生成裸照的模型,伪装成换装工具,目标直指女性和儿童。平台没有主动扫描,只靠用户举报,但正文没写审核团队规模和响应时间,这点信息缺口让严重性打了折扣。H、K、R 全中,但缺具体审核数据,所以没给到 85 分以上。

7月27日星期一

AI HOT 精选

月之暗面把 Kimi K3 的模型权重、技术报告和三项基础设施技术一起公开了

Kimi K3 是一个 2.8 万亿参数的混合专家模型,也就是把任务分给不同专家模块处理,不用每次激活全部参数,能省算力。它原生支持图片理解,单次能处理 100 万 token 的上下文,相当于一次能读完《三体》三部曲还有余。团队说规模化效率比上一代 K2.5 提高了 2.5 倍,这个数字说明用同样资源能训出更强的模型,或者训同样水平的模型成本更低。同...

推荐理由:月之暗面把 Kimi K3 的权重、技术报告和 infra 技术一起开源了,2.8 万亿参数 MoE,单次能吞 100 万 token,规模化效率比上一代提升 2.5 倍。国内旗舰模型完整开源是强信号,热度、知识量、可复现性三条全中。没给更高分是因为目前只有标题和摘要,具体训练成本、消融实验、真实场景跑分都还没看到,等报告正文出来再调。

AI HOT 精选

Kimi 开源 K3 模型:2.8 万亿参数 MoE,原生支持图像和 100 万 token 上下文

Kimi 把自家最强的模型 K3 开源了。这是个 2.8 万亿参数的混合专家模型,不用外挂就能直接理解图像,单次能处理的上下文长达 100 万 token。官方说新架构让每单位算力产出的智能提升了 2.5 倍——打个折理解,就是同等算力下模型更聪明了。这次不光放出了模型权重,还一起开源了高性能注意力计算内核、MoE 通信库和一个大规模智能体运行环境。正...

推荐理由:月之暗面把K3完整开源,权重、内核、通信库、智能体环境全给,不是只扔个模型。2.8T MoE、100万上下文、原生视觉,外加2.5倍算力效率的说法,信号很强。没给更高分是因为技术报告刚出,实际效果和效率提升还没被第三方验证,先打个折看社区反馈。

7月26日星期日

Computing Life · Share · 鸭哥调研

27B 模型塞进 iPhone 了,现在该问它到底能干嘛

Bonsai 27B 把 Qwen3.6-27B 压到了约 1.125 bit/权重,在 iPhone 17 Pro Max 上运行时占用约 3.9 GB 内存,15 项思考模式测试平均分 76.11,保留了原模型约 89.5% 的能力,但看图(59.57 分)和工具调用(66.03 分)掉得比较厉害。另一条路是 MiniCPM-V 4.6,总参数量 ...

推荐理由:Bonsai 27B 把 27B 模型跑在 iPhone 上,还给了真实跑分,这标志着讨论从技术可行性进入了产品化阶段。文章没停在跑分上,而是拆解了四个工程瓶颈:内存、发热、视觉预填充和可靠性。不足是 MiniCPM-V 4.6 那边的数据没给全,但整体判断很清醒,值得推荐给在端侧做模型选型的人。

7月25日星期六

Computing Life · Share · 鸭哥调研

Netflix 用 AI 做了约 300 部片子,主要在后期,不是一键拍电影

Netflix 在 2026 年二季度股东信里说,大约有 300 个片目用上了生成式 AI 的工作流,大头在后期制作。电话会议补充了具体用法:场景参考、镜头规划、预演和视觉特效。在《The American Experiment》里,17 分钟 AI 增强画面的制作速度大概是之前方案的两倍,成本降了一半——这只是个案,不能当成行业规律。Netflix ...

推荐理由:Netflix 首次披露 300 个片目用上生成式 AI,还拆了具体工作流和一个个案数字,HKR 全中。但个案不能推广,正文也没说 300 个片目占总量的比例、'片目'怎么定义,所以分数卡在 78,刚好进 featured。

Hacker News 首页

Anthropic 发布 Claude Opus 5 系统卡:代理编程和长任务能力大幅提升,对齐评分创下新高

Claude Opus 5 是 Opus 4.8 的升级版,主要提升在代理编程、操控电脑和长链条知识工作上,数学和科学推理也有进步。Anthropic 评估其整体对齐风险为“非常低”,模型没有跨过自动 AI 研发或新型生物武器的能力门槛。在自动化行为审计中,它的对齐得分超过了 Sonnet 5、Opus 4.8 和 Mythos 5,尤其遵守内部准则的...

推荐理由:Anthropic 发 Claude Opus 5 系统卡,是旗舰模型发布。文章给了对齐审计分数的具体排名和 RSP 风险判断,信息密度够,不是空话。但没放绝对 benchmark 数字,也没提价格,所以到不了 95 分。整体是安全侧的重要更新,从业者会存下来当参考。

7月24日星期五

Hacker News 首页

FLUX 3 开始控制机器人:一个模型同时生成视频和预测动作

Black Forest Labs 把早期版 FLUX 3 装到了 mimic 的机器人上,已经在奥迪产线做过测试。FLUX 3 是一个模型同时生成图像、视频和音频,其中视频预测占了训练算力的 95% 以上。为了不出现画面穿帮,模型必须学会接触、运动和因果关系。把动作预测作为低维模态加进去时,视频质量一度掉了 10%,但训练 3500 步后就完全恢复。...

推荐理由:Black Forest Labs 把早期版 FLUX 3 装到 mimic 机器人上,在奥迪产线做了测试。一个模型同时出图像、视频和音频,其中视频预测占了训练算力的大头。为了画面不穿帮,模型得学会接触和因果,把动作预测当低维模态加进去时视频质量一度掉了 10%,但 3500 步就恢复。跨模态加物理部署加具体数字,三条都踩中了。没给更高分是因为正文没披露测试规模、成功率或产线具体任务细节,我会先打个折。

AI HOT 精选

Black Forest Labs 发布 FLUX 3,一个模型搞定图像、视频和音频,一次能生成 20 秒带声音的视频

FLUX 3 用统一架构把图像、视频和音频放在一起学,不再拆成几个模型拼凑。它一次能输出最长 20 秒的视频,并且自带原生音频,支持文生视频、图生视频、视频续写、关键帧转视频和多镜头串联。在带声音的 10 秒 720p 视频人工评测里,FLUX 3 赢 Grok Imagine Video 的概率是 69%,对比 Seedance 2.0 和 Gemi...

推荐理由:Black Forest Labs 发了 FLUX 3,一个统一的多模态模型,能直接出最长 20 秒带声音的视频,不是老路子的图像模型加个音频插件。69% 的胜率对比 Grok Imagine Video 给了它一点底气。没给 85 分是因为正文没提公开测试或第三方实测,实际效果还得等上手。

The Verge · AI

Claude 的语音模式现在支持 Opus 和 Sonnet,还能读你的 Gmail 和 Slack

Anthropic 把语音模式从 Haiku 扩展到了 Opus 和 Sonnet,三个模型现在都能用语音交互了。更实际的变化是,语音模式可以接入 Gmail、Slack 这类应用,直接读出你的邮件和消息。不过正文没提延迟和准确率数据,实际体验好不好用,建议等上手测试再说。

推荐理由:Anthropic 把语音模式铺到了 Opus 和 Sonnet,还接上了 Gmail、Slack,实用性和话题性都有。但正文没给延迟和准确率数据,实际体验得等上手,所以分数压在 80 以下。

7月23日星期四

AI HOT 精选

谷歌把 Gemini 3.6 Flash 和 3.5 Flash-Lite 转正了,更便宜也更省 token

谷歌正式发布了 Gemini 3.6 Flash 和 3.5 Flash-Lite,两个模型都支持 100 万 token 的上下文窗口和 6.4 万 token 的最大输出。3.6 Flash 的定价是每百万输入 token 1.5 美元、输出 7.5 美元,比 3.5 Flash 便宜,官方说它在处理复杂的智能体任务和多模态任务时,用的推理步骤、对...

推荐理由:谷歌发了 Gemini 3.6 Flash 正式版,定价比 3.5 Flash 便宜,还强调在智能体和多模态任务上用了更少的推理步骤。有具体价格和规格,但正文没给基准测试或跟竞品的对比,所以重要性给到 78。

7月22日星期三

AI HOT 精选

实测通义千问图像模型 3.0:中文长文字不崩、多图融合能打,跟 GPT Image2 有来有回

阿里放出了 Qwen-Image-3.0,一次能塞 4.5k token 的指令,支持 12 种语言和 20 多种字体。作者拿它跑了 19 个场景,包括中文长文本、多语言混排、UI 界面、多图融合和图片编辑。结果文字基本不花,信息也对得上,画质跟 GPT Image2 差不多。国内直接能用,速度不慢,价格也不算贵,但正文没给出具体价格和延迟数字。

推荐理由:作者拿Qwen-Image-3.0跑了19个场景,中文长文本、多语言混排、UI界面、多图融合都测了,文字基本不花,画质跟GPT Image2差不多。对比做得挺实在,不是公关稿。扣分是因为正文没给出具体价格和延迟数字,想算成本的人还得自己去查。

Hacker News 首页

让 GPT-5.6、Claude、Gemini 和 Grok 用彩色铅笔“画”蒙娜丽莎

TryAI 搭了个画布擂台,给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 一套彩色铅笔工具,让它们照着蒙娜丽莎和星月夜两张图复刻,外加五道开放命题作画,一共跑了 28 幅。模型可以自己选颜色、笔尖粗细、下笔力度,还能涂抹、擦除、随时看一眼画布再改。GPT-5.6 Sol 在结构相似度(...

推荐理由:TryAI 搭了个画布擂台,给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 一套彩色铅笔工具,让它们照着蒙娜丽莎和星月夜复刻,外加五道开放命题,一共跑了 28 幅。模型可以自己选颜色、调笔尖粗细、控制下笔力度,还能涂抹、擦除、随时看一眼画布再改。GPT-5.6 Sol 在结构相似度上领先,但每笔成本也最高;Gemini 3.6 Flash 便宜但细节糊成一团。这个测试把“工具调用 + 视觉反馈”的差距直接摊在画布上,比跑分直观得多。