跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 81–100 条 · 共 514 条

7月22日星期三

AI HOT 精选

Google 发了三款新 Gemini 模型,但旗舰 3.5 Pro 还是没影

Google DeepMind 一口气放出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。3.6 Flash 是新的主力,写代码和处理多模态任务更强,token 消耗最多能降 17%,比上一代 3.5 Flash 更便宜。3.5 Flash-Lite 主打极致低成本,3.5 Flash Cyber ...

推荐理由:Google DeepMind 一次放出三款 Gemini 模型,3.6 Flash 当新主力,写代码和多模态能力有提升,token 消耗最多能降 17%,比 3.5 Flash 更便宜——这对开发者是实打实的成本信号。3.5 Flash-Lite 走极致低价路线,3.5 Flash Cyber 加了安全防护,定位清楚。但正文没提 3.5 Pro,缺了大家最想比的那块拼图。分数没给满,因为 TechCrunch 这篇信息量有限,很多技术细节和实测对比没展开。

7月21日星期二

Google DeepMind

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。

推荐理由:原文给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型变化。

7月17日星期五

Hacker News 首页

月之暗面发布 2.8 万亿参数 Kimi K3,自称首个开源 3T 级模型,API 定价看齐 Claude Sonnet

月之暗面推出了 Kimi K3,一个 2.8 万亿参数的模型,他们把它四舍五入叫成“首个开源 3T 级模型”。这个模型 API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。它自己公布的跑分大多超过了 Claude Opus 4.8 和...

推荐理由:月之暗面发了 Kimi K3,一个 2.8 万亿参数的模型,他们管它叫“首个开源 3T 级模型”,API 定价输入每百万 token 3 美元、输出 15 美元,跟 Claude Sonnet 一个价,是目前中国 AI 实验室里最贵的。自己公布的跑分大多超过 Claude Opus 4.8 和 GPT-5.5 high,但输给 Claude Fable 5 和 GPT-5.6 Sol。Simon Willison 的测试里 K3 在长周期知识任务上比前代 K2.6 涨了 732 Elo,输出 token 数少了 21%,成本降了 27%,说明模型在...

Sinocism · 比尔·毕晓普

WAIC 开幕前,中国推动 AI 新秩序,Kimi 发布开源大模型

世界人工智能大会(WAIC)开幕前一天,两条消息撞在一起。一是习近平设欢迎晚宴,王毅与 29 国代表签协议,要成立“世界人工智能合作组织”。央视账号玉渊谭天发文解释,中国想探索另一种 AI 秩序:开源、全要素共享,打破闭源模型和算力限制造成的技术依赖。二是月之暗面发布 Kimi K3,一个 2.8 万亿参数的开源模型,支持 100 万 token 上下...

推荐理由:WAIC 开幕前一天,两条消息撞在一起。一是习近平设欢迎晚宴,王毅与 29 国代表签协议,要成立“世界人工智能合作组织”。央视账号玉渊谭天发文解释,中国想探索另一种 AI 秩序:开源、全要素共享,打破闭源模型和算力限制造成的技术依赖。二是月之暗面发布 Kimi K3,一个 2.8 万亿参数的开源模型,支持 100 万 token 上下文。政策信号和产品发布同一天出现,时间点本身就值得讨论。有具体新事实:29 国签协议成立 AI 合作组织,明确提“开源、全要素共享”作为另一种 AI 秩序;Kimi K3 是 2.8 万亿参数的开源模型,支持 100 ...

AI HOT 精选

xAI 不再嘴硬说 Grok 不会生成儿童性虐待图像,转而起诉用户

xAI 第一次起诉了一名用 Grok 生成儿童性虐待图像的用户。公司之前一直说这种内容是用户自己搞出来的,但这次起诉等于变相承认模型确实能被用来产出非法内容。文章没提具体用了什么安全措施、哪个模型版本,也没说有多少用户受影响。这看起来更像是法律层面的止损操作,而不是技术上的修复。

推荐理由:xAI 第一次起诉用户用 Grok 生成儿童性虐待图像,这等于在法律层面承认模型能被滥用,之前公司一直说内容是用户自己搞出来的。文章没写具体安全措施、模型版本和受影响用户数,所以分数压在 85 以下。但这件事从口头否认变成法律止损,对行业来说是个信号,我会先打个折,等更多技术细节出来再调整。

7月16日星期四

Latent Space

Lila Sciences 想把实验室变成数据中心,让 AI 24 小时不停做实验

Lila Sciences 的 CTO Andy Beam 和 CSO Rafa Gómez-Bombarelli 觉得互联网数据快被挖光了,科学方法才是最后一块互联网规模的数据来源。他们把实验室当成一个无限生成数据的机器:用强化学习提假设,让自然界来验证。目前他们已经产出了超过 10 万亿个经过实验验证的科学推理数据点。他们的自动化实验室用视觉语言模...

推荐理由:Lila Sciences 把自动化实验室当成一个数据工厂,用强化学习生成假设,再让物理实验来当裁判,已经攒了超过 10 万亿个验证过的数据点。这个思路对 AI 从业者来说很新鲜,因为它把“数据枯竭”这个焦虑引向了一个具体的解法。不过内容本身是播客访谈,没有可复现的论文或开源代码,所以我会先打个折——想法很硬,但落地细节和可验证性还差一口气。

AI HOT 精选

天工短剧工作台上线导演Agent和无限画布,自动拆剧本、定机位,解决AI短剧角色乱跑和变脸问题

天工短剧工作台这次放出了两个东西:一个叫导演Agent,能自动把剧本拆成分镜,规划演员站位和镜头角度,同时生成多视角的细节图,专门解决AI短剧里角色脸变来变去、位置漂移的老毛病。另一个是无限画布,配合内置的影视级提示词模板、720°全景图和3D导演台,让制作过程更可控。他们已经有3部作品在海外短剧平台DramaWave上线,7天营收破百万美元。不过正文...

推荐理由:天工短剧工作台放出了导演Agent和无限画布,直接打AI短剧角色一致性的老毛病。Agent能自动拆分镜、定站位和镜头角度,还生成多视角细节图,不是单纯换提示词。三成作品在DramaWave上线,7天营收破百万美元,商业上已经跑通了。不过正文没给技术细节和一致性量化指标,这点先别太激动,等更多作品出来再看。

The Verge · AI

xAI 起诉一名用户,指控他用 Grok 生成儿童性虐待材料的深度伪造图

马斯克的 xAI 向联邦法院起诉了 Terry Harwood,说他绕过了 Grok 的安全护栏,用“提示词注入”之类的手段生成了儿童性虐待材料(CSAM)的深度伪造图。这是 AI 公司主动起诉用户生成违法内容的罕见案例,但报道没披露他具体用了什么技术、生成了多少张图。xAI 在诉状里要求赔偿名誉损失和法律费用,不过这种“用户滥用模型”的官司,能不能真...

推荐理由:xAI 起诉用户用 Grok 生成 CSAM 深度伪造图,是少见的 AI 公司追着终端用户打的案例。话题够硬,但正文没披露具体技术手段和生成数量,事实密度偏薄,所以分数没往上拉。

Hacker News 首页

两拨朋友用 AI 做了几乎一模一样的婚礼视频

作者参加了一场婚礼,新娘的朋友和新郎的朋友各自用 AI 做了一段致敬视频。两段视频讲的故事不同,但成品高度雷同:旁白的语气和节奏一样,都用了飞越海滩、穿过森林和星空的空镜,连国家地理风格的解说词都撞了。现场宾客反而觉得这个巧合很好玩。作者认为日常创作正在被 AI 拉向一个平庸的均值,但没下结论这到底是因为大家怕做出烂东西,还是单纯选了最省事的路径。

推荐理由:一篇个人随笔,靠一个具体的婚礼视频撞车故事把现象讲透了,没有硬塞结论。撞车这个钩子同时踩中 H、K、R 三个点。扣分项:纯观点文章,没数据也没解法,停在描述现象这一步。72 分合理,我会先打个折,因为信息密度不算高,但读起来确实有触动。

7月15日星期三

TechCrunch · AI

苹果 AI 功能拿到中国准入许可,底层用阿里的通义千问模型

中国网信办批准了 Apple Intelligence 在国内上线,前提是苹果把阿里的通义千问(Qwen)模型集成到 iOS、iPadOS、macOS 和 visionOS 里,负责文字和图片的理解与生成。阿里确认了合作,但没给具体上线时间。苹果之前找过百度、DeepSeek 和字节跳动,都因为模型适配问题没谈成。大中华区对苹果很重要,上季度卖了 20...

推荐理由:这条消息的份量在于它把中美 AI 落地规则撞在了一起。苹果为了进中国,必须换掉自己的模型,用本地供应商的,而且前面三家都没谈成——说明不是随便找个合作方就能过审,技术适配和监管要求之间有硬摩擦。我会先打个折:正文没披露具体上线时间,也没说 Qwen 模型是端侧跑还是云端调,这点先别太激动。但审批通过本身和谈判失败的原因,已经足够让从业者重新掂量“海外 AI 进中国”的成本和路径了。

Hacker News 首页

PrismML 发布 Bonsai 27B:第一个能在手机上跑的 270 亿参数模型

PrismML 把 Qwen3.6 27B 压缩到了 3.9 GB,塞进了 iPhone 17 Pro。他们做了两个版本:三元版(5.9 GB)保留了原版 95% 的能力,1-bit 版(3.9 GB)保留了 90%。数学和编程分数几乎没掉,工具调用也撑住了,但视觉任务退化比较明显。两个版本都能处理图像,支持 26 万 token 的上下文和投机解码加...

推荐理由:PrismML 把 Qwen3.6 27B 压到 3.9 GB,装进 iPhone 17 Pro,三元版 5.9 GB 保留 95% 能力,1-bit 版 3.9 GB 保留 90%。数学和编程分数稳住了,工具调用也没崩,但视觉任务退化明显,这点先别太激动。正文没披露推理延迟和功耗,实际用起来烫不烫手还不清楚。整体是端侧部署的一个里程碑,但视觉短板和缺失的实测数据要打个折。

7月14日星期二

Ben's Bites

OpenAI 发布 GPT-5.6:三个模型、五档思考强度,外加一个会疯狂派生子智能体的 Ultra 模式

GPT-5.6 系列包含 Luna、Terra 和 Sol 三个模型,每个模型都提供从“轻度”到“最大”五档思考强度,以及一个 Ultra 模式。Ultra 模式会让模型大量派生子智能体来干活,非常消耗使用额度。OpenAI 还把 macOS 版 ChatGPT 和 Codex 应用合并成了新的 ChatGPT Work 应用,并推出了一个叫 Chat...

推荐理由:GPT-5.6 正式上线是本周最大的产品新闻之一,三模型加 Ultra 的设定值得从业者关注。扣分是因为这是一篇教程复盘而非官方发布公告,而且正文被截断,关键细节缺失,信息不够完整。

7月13日星期一

AI HOT 精选

字节 Seedream 5.0 Pro 实测:在图上打点、画框就能换沙发改颜色,其他区域不动

Seedream 5.0 Pro 把图像编辑的门槛压得很低。你可以在图片上打点、画框或者随手涂一下,然后在提示词里用 @ 标记,就能精准换掉沙发、改墙面颜色,画面其他部分保持不变。官方放出的案例包括一次性替换六件家具、做键盘爆炸拆解图并标注卖点、在画好的框里生成海报文字,还支持色卡配色和 SKU 换色。图像质量和提示词理解能力追平 GPT-Image ...

推荐理由:字节把图像编辑的交互改得很直接:打点、画框、涂鸦加 @ 标记,比多数现有工具更符合直觉。官方放出的案例信息密度高,覆盖家具替换、爆炸图、海报文字和 SKU 换色,对电商和设计场景的实用性很明确。图像质量声称追平 GPT-Image,但正文没披露对比方法、测试集和量化指标,验证强度弱,所以判断上我会先打个折。

7月11日星期六

Hacker News 首页

Meta 上线几天就紧急下架 Muse Image,因为默认把用户照片喂给 AI 生图

Meta 周二在 Instagram 上线了 AI 生图工具 Muse Image,允许任何人用公开账号的内容生成 AI 图片,而且用户被默认加入,不用事先同意。这个设定立刻引发隐私争议,Meta 承认“没把握好分寸”,几天后就把功能撤了。好莱坞工会 Sag-Aftra 和 Privacy International 都公开批评,前者说这是对公众情绪的...

推荐理由:Meta 的产品回滚加上好莱坞工会下场,让这件事从产品失误升级成行业信号。分数没再往上拉,是因为功能已经撤了,正文也没给技术细节,目前只能当一次公开舆论事件来看。

TechCrunch · AI

Meta 上线不到一周就砍掉了 Instagram 的 AI 改图功能,因为用户不买账

Meta 在 7 月 7 日推出了一个叫 Muse Image 的 AI 图片生成器,其中有个功能是你可以 @ 任何公开的 Instagram 账号,拿对方发的照片当参考图来生成新图片,而且对方完全不会收到通知。这个设计立刻引发大量反对,TechCrunch 还专门出了教程教大家怎么关掉这个功能。Meta 在 7 月 10 日的博客里承认这个功能“没做...

推荐理由:Meta 上线了一个叫 Muse Image 的 AI 生图功能,允许用户 @ 任何公开 Instagram 账号,拿对方照片当参考图生成新图片,全程不通知对方。这个设计立刻炸锅,TechCrunch 专门写教程教人怎么关掉,Meta 三天后发博客承认“没做好”并撤下功能。我会先打个折:正文没披露具体影响用户量或技术细节,所以重要性停在 78。但这件事的传播链条完整,从上线到撤回节奏极快,对 AI 产品设计里的默认同意问题是个很直观的案例,值得放进精选。

AI HOT 精选

Meta 上线两天就关掉了 Instagram 里用公开账户生成 AI 假照片的功能

7 月 8 号 Meta 在 Instagram 私信里塞了个叫 Muse 的功能,用户给 @MetaAI 发一句“imagine me as [某个公开账户]”,就能生成一张模仿对方风格的假照片。两天后因为反对声太大,Meta 把这功能关了。发言人只确认功能已下线,没解释原因。文章没披露到底有多少人用过、有没有造成实际伤害,看起来更像是一次快速试水被...

推荐理由:Meta 在 Instagram 私信里上线了一个叫 Muse 的功能,用户发一句“把我想象成某个公开账户”就能生成模仿对方风格的假照片,两天后因为反对声太大紧急关停。这事反转够快,天然吸引点击,但文章没披露实际使用数据和伤害案例,信息量偏薄。我会先打个折:话题性拉满,可验证的事实太少,只能给到 featured 的下沿。如果是真的没造成什么实际伤害就还好,但平台这种先上线再灭火的试探方式,本身就值得安全方向的人留意。

7月9日星期四

Ben's Bites

SpaceXAI 和 Cursor 联手训出 Grok 4.5,成本只有 Opus 的六分之一

SpaceXAI 和 Cursor 一起训了个新模型 Grok 4.5,性能大概卡在 Opus 4.7 和 4.8 之间,但按 token 算钱的话,比 Opus 便宜 6 倍,比 GPT-5.5 便宜 3 倍。现在 Cursor 里能用,API 也开放了。OpenAI 这边,GPT-5.6(Sol、Terra、Luna)今天会推给所有用户,早期测试的...

推荐理由:SpaceXAI 和 Cursor 联合发布 Grok 4.5,有具体性能区间和价格对比,三个维度都踩中了。扣分是因为来源是 newsletter 摘要而非一手公告,且正文截断,GPT-5.6 信息不全。跨源验证后加 3 分到 82,整体判断不变。

Latent Space

SpaceXAI 发布 Grok 4.5,跟 Cursor 联手训了个主打编程和干活儿的模型

SpaceXAI 赶在 GPT-5.6 发布前一天放出了 Grok 4.5。这是个 1.5 万亿参数的大模型,比上一代 Grok 4.3 大了三倍,专门冲着编程和让模型进业务流程干活儿去设计的。Cursor 说这是他们头一回把模型能力扩展到纯写代码之外。马斯克自己讲,这模型跟 Opus 4.7 性能差不多,但更快更省钱——输入每百万 token 收 2...

推荐理由:SpaceXAI 在 GPT-5.6 发布前一天扔出 Grok 4.5,光这个时间点就值得看一眼。1.5 万亿参数,比 Grok 4.3 大了三倍,输入每百万 token 收 2 美元,规模和成本都有具体数字。马斯克说性能跟 Opus 4.7 差不多但更快更便宜——这点先别太激动,正文没给第三方跑分,只能当官方说法。真正有意思的是 Cursor 被收购后第一次把模型推到纯写代码之外,直接瞄准 agent 工作流,对做工具链的人是个信号。

AI HOT 精选

诉讼称一男子用 Grok 生成 7000 张继女色情图片后自杀,xAI 只上报了一条轮奸提示词

一起新诉讼指控 xAI 的 Grok 被用来生成了超过 7000 张用户继女的儿童性虐待图片,该男子随后开枪自杀。xAI 只向美国国家失踪与受虐儿童中心上报了一条涉及轮奸的提示词,其余数千次生成均未报告。诉讼指责 X 和 xAI 在庇护儿童侵害者。文章没有解释为什么 xAI 的安全过滤器漏掉了绝大多数图片,也没有说明 Grok 的图像生成功能是否默认禁...

推荐理由:Ars Technica 独家报道了一起针对 xAI 的诉讼,揭示其安全上报存在严重漏洞:在 7000 张儿童性虐待图像中,仅上报了一条提示词。事件涉及未成年人、自杀和平台责任,三条硬指标全中。我会先打个折,因为文章没解释 Grok 的安全过滤器为什么漏掉这么多,也没说明图像生成功能默认是否关闭,信息缺口明显,所以分数压在 90 以下。

7月8日星期三

Hacker News 首页

Mistral 发布 Robostral Navigate:一个只用单摄像头的机器人导航模型

Mistral 推出了一个 80 亿参数的模型,让机器人只靠一个普通 RGB 摄像头就能在室内外认路,直接输出速度和转向角。它跳过了激光雷达和高精地图,思路是降低硬件门槛。不过公告里没提延迟、帧率、跑在什么硬件上、用了多少训练数据,也没给具体的测试基准分数。这点先别太激动,等第三方实测再说。

推荐理由:Mistral第一个机器人模型,纯视觉导航,80亿参数,有明确输入输出,是个实在的发布。但公告没提延迟、帧率、硬件需求、训练数据和基准分数,没法判断真实可用性,所以先放在featured档,等第三方实测再说。