跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–120 条 · 共 514 条

7月8日星期三

TechCrunch · AI

Meta 推出 Muse Image 生图工具,用户照片被拿来 AI 改图引发反弹

Meta 在 7 月 7 日上线了 Muse Image,一个由旗下 Superintelligence Labs 做的免费 AI 生图工具,可以在 Meta AI 应用、Instagram 快拍和 WhatsApp 里用。功能本身跟主流生图工具差不多,还提供预设提示词帮你起头。争议点在于:你可以在 Instagram 上 @ 任何公开账户,直接把对方...

推荐理由:Muse Image 上线本身是个常规产品动作,但用户对照片被用于训练的反弹来得又快又猛,让这件事有了超出产品发布的社会情绪价值。技术细节没给,知识分上不去,刚好卡在 featured 门槛。

AI HOT 精选

Meta 发了两个新模型 Muse Image 和 Muse Video,一个画图一个做视频,都接进了 Instagram 和 WhatsApp

Meta 的超级智能实验室放出了 Muse Image 和 Muse Video,这是他们头一批媒体生成模型。Muse Image 主打听话出图,能按指令精确生成、编辑图片,还能参考多张图来构图,并且会读 Instagram 上的社交信息当上下文。它还能调用工具干活,集成了一个叫 Muse Spark 的东西,具体是什么正文没细说。Muse Video...

推荐理由:Meta 的超级智能实验室头一回发媒体生成模型,Muse Image 主打听话出图和读 Instagram 社交信息,Muse Video 正文没展开。有个叫 Muse Spark 的工具集成进去了,但具体是啥没说,实际出图出视频的质量也没给例子。我会先打个折,给 78 分,等看到真东西再调整。

AI HOT 精选

字节跳动发布 Seedream 5.0 Pro,能直接生成信息图,还能像修图软件一样做像素级编辑

这个模型把“生成图片”和“专业设计”之间的沟填上了不少。它最狠的地方是能直接生成高密度信息图,比如把时间轴、柱状图、饼图和实景融合在一张图里,文字拼写和排版都挺靠谱。编辑能力也上了一个台阶,支持点选、圈选、涂鸦来局部改色、换材质,甚至能把一张海报拆成十几个独立图层,被挡住的背景也能自动补全。人像和材质质感有提升,能还原皮肤纹理、玻璃反射,还支持摇拍的运...

推荐理由:字节放出的 Seedream 5.0 Pro 在功能描述上很具体,不是笼统的“画质提升”。信息图生成、图层分离、交互式局部编辑这三板斧确实打到了设计场景的痛点。但得先打个折:这是官方博客,没有第三方评测或开放试用,实际效果和稳定性还不好说。正文也没披露推理成本、生成延迟和分辨率上限,这些对落地很关键。

7月2日星期四

Ben's Bites

Fable 5 重新上线,同时来了个新的 Claude Sonnet 5

Anthropic 把 Fable 5 又放出来了,付费用户能用,但只到 7 月 7 号,而且用量上限砍半。官方说这次加了更强的安全护栏。Scale 的跑分显示它能完成 16% 的远程工作任务,是 Opus 4.8 的两倍。同时发布的 Claude Sonnet 5 跑分接近 Opus 4.8,单 token 价格更低,但实际跑一个任务的总花费差不多,...

推荐理由:Anthropic 同时放出 Fable 5 的限时回归和 Sonnet 5,两条消息叠在一起。Scale 的跑分给了可对比的硬数字,不是纯宣传稿。Fable 5 的 16% 任务完成率虽然翻倍但绝对值还低,所以重要性没推到 90 以上。

Latent Space

AIEWF 第三天:自动研究站上舞台,但讲者们对全自动泼了冷水

AI 工程师世界博览会第三天,主题是“自动研究”——让 AI 智能体自己维护和改进系统。Introspection 的 Roland Gavrilescu 把它描述成一个“外循环”,让智能体去研究和维护内循环。Anthropic 的 Thariq Shihipar 在 Claude Code 演讲里也呼应了持续发现的想法,说模型是“长出来的,不是开发出...

推荐理由:这是 AIEWF 现场的实况报道,引用了 Introspection 和 Anthropic 的一手发言,不是通稿。但本质是会议综述,不是产品发布,所以放在 featured 这一档刚好。

6月26日星期五

AI HOT 精选

博主小互开源了个人IP配图工具,自带31个原创角色和一套自动配图流程

小互把给自己文章自动配图的技能打包开源了,叫“小互IP Studio”。工具里带了31个原创角色——15个是手绘线稿风格的人物,另外16个是谐音梗做成的meme形象。工作流程是:Agent先读文章,自己判断该配情绪图、示意图还是四格漫画,然后生成图片,再自己检查,不满意会返工重来。默认画风是手绘线稿加淡彩,另外给了5种皮肤可以换,比如3D盲盒风、黑白线...

推荐理由:一个实用工具的开源发布,工作流设计有细节,31个原创角色直接可用,对AI内容创作者价值明确。但这是个人项目开源,不是行业级事件,所以放在featured档。

Hacker News 首页

AI 做的儿童百科成了身体恐怖片,我买了本亚马逊畅销第一来实测

作者 lcamtuf 买了本 2026 年中出版的 AI 生成儿童百科全书,这本书在亚马逊拿过分类第一。翻开之后插图全是身体恐怖:猫多长了腿、动物和树融成一团肉块、倒影里的人伸手要抓你。他认为这类书能卖是因为买的人不读,封面骗过了送礼的亲戚朋友,而且做百科没有小说那种版权风险。文章没检查文字内容有没有事实错误,但光看图已经够吓人了。

推荐理由:lcamtuf 亲自买了本亚马逊分类第一的 AI 儿童百科,把插图里的身体恐怖一页页拍了下来。有具体例子,有销售机制分析,不是空喊“AI 质量不行”。扣分是因为没查文字内容有没有事实错误,而且文章本身是个人博客,验证力度弱。

6月25日星期四

AI HOT 精选

Gemini 3.5 Flash 现在能直接操作电脑界面了

Google 给 Gemini 3.5 Flash 加了一个内置的“操作电脑”工具,模型可以自己截图、点按钮、填表单,去操作网页和桌面软件界面。这跟 Anthropic 和 OpenAI 之前做的方向一样,都是把屏幕控制能力直接做进模型里。官方说在 WebVoyager 这个网页操作基准测试上,3.5 Flash 跑赢了 Claude Sonnet 4...

推荐理由:Google 给 Gemini 3.5 Flash 内置了电脑操作工具,模型能自己截图、点按钮、填表单,跟 Anthropic 和 OpenAI 的路线一致。官方在 WebVoyager 基准上跑赢了 Claude Sonnet 4,这点有数字撑腰。但我会先打个折:这是一篇博客公告,没给 API 定价,也没说实际延迟,所以现在只能当技术方向看,还不能直接算账。

6月24日星期三

AI HOT 精选

ChatGPT 语音能边听边说了,新模型 Bidi 1 开始灰度测试

部分用户已经在 ChatGPT 网页版和 App 的模型选择器里看到了 Bidi 1,和标准语音、高级语音并列,选中后语音气泡会变黄。它最大的变化是支持全双工:模型在说话的同时还能继续听你讲话,中途打断也能立刻响应。测试里有人让它从 1 数到 10,数到一半打断说“倒数”,它马上照做。OpenAI 还没正式公布上线时间,有媒体猜本周可能会扩大测试范围。...

推荐理由:OpenAI 语音能力一次实质升级——全双工加打断响应是之前高级语音模式做不到的。目前只部分推送、官方还没正式公告,所以分数不往上顶。但交互方式的改变够得上 featured。

6月23日星期二

FT · 科技

OpenAI 生图翻车,给 Getty Images 打了一个价值连城的广告

OpenAI 的图像模型用 Shutterstock 的图库训练,结果生成的照片里意外带上了 Getty Images 的水印。这个乌龙成了 Getty 最好的广告:高质量授权内容不是合成数据能替代的。AI 公司越依赖廉价图库,Getty 手里那些独家、可商用的稀缺内容就越值钱。

推荐理由:FT 这篇评论角度很刁,把一个模型水印 bug 翻成了 Getty 内容壁垒的活广告。有具体事件,也有行业层面的判断,不是空谈。我会先打个折:它不是突发新闻,是评论,而且 FT 有付费墙,但事件本身够有说服力,读起来像在群里转发一个行业笑话,背后逻辑却挺硬。

AI HOT 精选

字节跳动发布 Seed2.1 系列模型,重点提升让模型干活时的交付稳定性

Seed2.1 系列模型已在豆包和 TRAE 上线,主打真实工作场景,而不是刷榜。在通用 Agent 任务上,Seed2.1 Pro 在 Agents' Last Exam 里排第一梯队,在测手机操作的 MobileWorld 上拿了最高分,跨工具任务的平均步数减少了 16%。写代码方面,开发者盲测中对比 Claude Opus 4.6 有 59.1%...

推荐理由:Seed2.1 是字节跳动的新旗舰,主打真实工作场景而非刷榜,在 Agent、代码、多模态三个方向都给了可验证的指标。Agent 考试排第一梯队、手机操作最高分、跨工具步数减少 16%,代码盲测胜率 59.1% 直接对标 Claude Opus 4.6,这些数字让发布有分量。我会先打个折:正文没披露参数量、训练数据和定价,所以模型实际规模和部署成本还不清楚,这点先别太激动。但作为国内大厂旗舰更新,且已上线产品,给 82 分 featured 合理。

AI HOT 精选

Runway 把视频编辑模型 Aleph 2.0 塞进了 Figma Weave 画布里

Aleph 2.0 现在能在 Figma Weave 里直接用了。用法很简单:从视频里抽一帧出来,在 Weave 里重新画个风格或者换个产品,标上时间点,Aleph 2.0 就会自动把这一帧的改动同步到视频里所有出现这个主体的画面上,其他没让你改的地方保持原样。它支持最长 30 秒的 1080p 视频,多镜头片段也能一次处理,不用一帧一帧修。在 Wea...

推荐理由:Runway把自家最强的视频编辑模型塞进了Figma Weave,用关键帧驱动多镜头同步修改。产品集成做得挺实在,但不算模型层面的突破,受众偏设计/视频圈而非核心AI圈,刚好卡在featured门槛上。

6月21日星期日

Hacker News 首页

旧金山一家代理商把畅销书整本搬上网,用 AI 配图后当成自己的作品

John Koenig 花了十几年做的《The Dictionary of Obscure Sorrows》——一本给说不清的情绪造词的畅销书——被旧金山代理商 Qontour 整本复制到了一个新网站上。网站域名只比原作多一个“the”,里面塞满了原书的 311 个自创词、词源解释和那篇 800 字的前言,但把原版的手工拼贴插画全换成了 DALL·E ...

推荐理由:一个版权盗窃故事,正好戳中创作者在 AI 时代最怕的事:整部作品被复制、用 AI 重新包装、然后当成正版发布。三个维度都有足够细节支撑,读起来像在跟朋友讲一件离谱但真实的行业八卦。没给更高分是因为它本质上还是一篇版权纠纷报道,技术层面的新信息不多,但作为警示案例已经够用了。

6月19日星期五

Computing Life · Share · 鸭哥调研

Midjourney 不拿风投,用生图订阅的钱造了一台全身超声扫描仪

Midjourney 在旧金山发布了一台全身超声 CT 扫描仪。人站在装满水的环形水槽里,40 颗 Butterfly 超声芯片从四面八方发射声波,21 台服务器靠 2 PFLOPS 算力重建出三维截面图。这台机器扫不了大脑、肺和肠道,定位是体成分分析,走 FDA 二类器械审批,第一家店不是医院,是旧金山 Union Square 的一家 spa。真正...

推荐理由:Midjourney 用生图订阅的现金流造了一台全身超声 CT,这个反 VC 叙事和扎实的硬件参数本身就很有传播力。我会先打个折,因为机器目前没用上 AI,物理限制也写得很清楚(扫不了脑、肺、肠道),定位是体成分分析,第一家店开在 spa 而不是医院,离临床落地还有距离。但正是这种“不烧钱、不画饼、先做一台能用的机器”的做法,在 AI 圈里太少见了,值得推一把。

6月18日星期四

AI HOT 精选

Adobe 在 Photoshop、Premiere 等主力软件里上线 AI 助手公测,专门处理重复性杂活

Adobe 把它的“创意智能体”塞进了 Premiere、Photoshop、Illustrator、InDesign 和 Frame.io,现在是公开测试版。你告诉它要什么结果,它自己去跑多步骤的体力活:比如在 Premiere 里自动分素材、标采访问题、拼粗剪;在 Photoshop 里换背景、按平台尺寸批量改图;在 Illustrator 里根据...

推荐理由:Adobe 在核心创意工具里集成 AI 智能体,是实打实的产品更新,不是概念稿。公开测试版意味着功能已经能跑,但 Adobe 过去交付 AI 功能的速度偏慢,所以先别当正式版看。功能描述具体,能判断实际价值,但效果和稳定性还得等用户上手反馈。

Hacker News 首页

ChatGPT 图片生成器被一个病毒式提示词绕过,会自发产出性暴力与虐杀画面

Mindgard 的研究员 Jim Nightingale 发现,一个在 X 上流传的提示词能绕过 ChatGPT 的图片生成过滤。这个提示词只是让模型“修复附件照片”,不指定任何内容,但 ChatGPT 却会生成涉及死亡和性侵犯的极端画面。Nightingale 之前就向 OpenAI 报告过模型能生成裸照,OpenAI 当时说问题已解决,但他发现漏...

推荐理由:我会先打个折:正文没披露具体复现次数和影响范围,所以别急着说“ChatGPT 彻底崩了”。但 Mindgard 研究员发现的问题确实扎心——一个在 X 上流传的提示词,只让模型“修复附件照片”,不指定任何内容,ChatGPT 却自己生成涉及死亡和性侵犯的极端画面。研究员之前就向 OpenAI 报告过模型能出裸照,OpenAI 当时说问题已解决,结果这次又漏了。这说明图片生成的安全过滤在“无内容指令”场景下存在盲区,模型可能把空白提示当成了自由创作许可。对从业者来说,这条信息直接指向安全测试的新方向:别光测有恶意的提示词,也要测“什么都没说”的情况。

6月17日星期三

AI HOT 精选

Midjourney V8.1 上线草稿模式:一次出 24 张低清预览,只花一半快速时长

Midjourney 给 V8.1 加了个草稿模式,点一下闪电按钮就能用。每次生成 24 张低分辨率、低画质的预览图,消耗的快速时长只有标准 V8.1 作业的一半。挑出满意的图点“Vary”就能渲染成高清成品。另外还出了个 --preview 参数,可以提前试玩还在打磨的新模型,但出图可能比较糙,而且不保证效果一直稳定,尤其在个性化设置和情绪板下差异会...

推荐理由:Midjourney V8.1 的草稿模式直接砍半快速时长成本,一次出 24 张低画质预览,挑中再高清化,对重度用户是肉眼可见的效率提升。--preview 参数给了尝鲜入口,但官方自己打了预防针说输出不稳定,这点先别太激动。H 和 K 都踩中了,R 确实够不着,因为这事基本只在生图圈子里传。

彭博科技

一封商务部长来信,让 Anthropic 主动关掉了 Mythos 的生图功能

Bloomberg 公开了美国商务部长 Howard Lutnick 发给 Anthropic 的完整信函。信里要求 Anthropic 解释为什么 Mythos 能生成特朗普和马斯克的深度伪造图像,并质疑了它的内容审核机制。Anthropic 随后自愿禁用了 Mythos 的图像生成能力。文章没说明这次关停是临时还是永久,也没给出恢复时间表。

推荐理由:Bloomberg 把 Lutnick 写给 Anthropic 的信全文放出来了,这是政府直接施压让 AI 功能下线的罕见案例。信里点名 Mythos 能生成特朗普和马斯克的深度伪造图像,质疑审核机制,Anthropic 随后自愿禁用了图像生成。文章没写这次关停是临时还是永久,也没给恢复时间,但光凭“部长一封信就让功能没了”这件事,对政策圈和安全从业者的冲击就够大。三个维度都踩中,分数维持 84 没问题。

6月16日星期二

AI HOT 精选

苹果 AI 版 Siri 为什么拖了这么久:旧方案直接扔掉,底层全部重写

苹果 Siri 项目的新负责人 Mike Rockwell 在 WWDC 闭门分享会上交了底。去年他们其实已经做出了一个能跑的原型,就是在老 Siri 上加了个工具调用功能,但团队觉得这离想要的产品体验差太远。于是他们选了另一套需要大改底层架构的方案,把旧 Siri 的架构完全拆掉,基于新的大模型从头搭建。新版 Siri 变成了一个独立应用,原生支持多...

推荐理由:我会先打个折:正文没披露新模型的具体规模、延迟数据和上线时间,所以没法判断实际体验能提升多少。但这条消息的看点在于,苹果 Siri 的新负责人罕见地公开解释了延期原因——不是没做出来,而是去年那个能跑的原型被主动否掉了,理由是“离想要的产品体验差太远”。团队选了更彻底的重构路线,把老架构拆掉,基于新大模型从头搭,Siri 变成了独立应用。这个决策本身就有信息量:大厂在旧系统上修修补补的成本已经高到不如推倒重来。对行业来说,这是一个关于技术债和架构选择的真实案例,不是公关稿。

6月14日星期日

彭博科技

苹果新 Siri 上手:刚好够用,暂时缓解了 AI 危机

Bloomberg 的 Mark Gurman 在 iOS 27 和 macOS 27 上实测了新 Siri。它能看懂屏幕上的内容,也能跨 App 干活——比如用一句语音指令找到一张照片、编辑后再通过信息发出去。复杂任务还是要等 11 秒以上,偶尔会漏步骤。Gurman 的评价是“刚好够用”:比老 Siri 进步巨大,但仍落后于 Google Astr...

推荐理由:Gurman 的实测比官方演示更有参考价值,因为他直接报了延迟和失败情况。我会先打个折:这不是正式发布,只是开发者预览版的表现,而且他自己也承认仍落后于 Google Astra。分数定在 78,是因为这算一次重要的进度检查,但远没到“成了”的程度。