跳到正文

#多模态

今日 1 条

8月11日星期二

纽约时报中文网

Meta 把付费模型 Muse Spark 免费开放了,新模型叫 Muse Glimmer

Meta 发布了一个叫 Muse Glimmer 的开放权重模型,它和上个月推出的付费闭源模型 Muse Spark 几乎一样,能生成代码、文字和图片。开放权重意味着你可以下载模型文件自己跑,但底层代码没全公开,不算彻底的开源。扎克伯格同时发了篇 14 页的文章,核心观点是超级智能不该被几家大公司攥在手里,并宣布拿 10 亿美元投给数据中心所在的社区。...

推荐理由:Meta 把付费闭源模型 Muse Spark 的能力几乎原样搬到了一个叫 Muse Glimmer 的开放权重版本里,你可以下载模型文件自己部署,但底层训练代码没给,不算彻底开源。扎克伯格同步发了篇长文,核心就一句话:超级智能不该锁在几家公司手里,并宣布拿 10 亿美元投给数据中心所在的社区。我会先打个折——开放权重不等于开源,别看到“开放”就以为什么都能改;但如果是真的和付费版性能接近,那对想自己跑模型又不想被 API 绑住的团队来说挺省钱。正文没披露 Glimmer 和 Spark 的具体评测对比数字,这点先别太激动,等跑分出来再看。

8月10日星期一

AI HOT 精选

SGLang 第一时间适配 Meta 的本地智能体模型 Muse Glimmer,单卡 RTX 5090 跑到每秒 1452 个 token

Meta 发布了 Muse Glimmer,一个 300 亿参数的多模态模型,专门为在本地硬件上跑智能体工作流设计。SGLang 推理框架在发布当天就提供了支持,并做了针对性优化。在单张 RTX 5090 显卡上,用 NVFP4 量化格式搭配 DFlash 投机解码技术,每个用户的解码速度能达到每秒 236 个 token,总吞吐量冲到每秒 1452 ...

推荐理由:Meta 发新模型本身是行业事件,但这篇文章的重点是 SGLang 的推理优化,不是模型本身。好在性能数字够硬,236 tok/s 和 1452 tok/s 这两个数让它的信息密度够上 featured。不过受众窄,只对搞本地推理的人有吸引力,所以 r 给了 false。

Hacker News 首页

Meta 开源 Muse Glimmer:一个能在本地单 GPU 上跑的 30B agent 模型

Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了。这是一个 30B 参数的模型,专门为常驻本地的 agent 工作流设计,小到能在 Mac 或 PC 的单张消费级显卡上跑。用 4-bit 量化能把模型压到 20 GB 以下,在 24 GB 或 32 GB 显存里还能留出空间给 KV cache 和视觉编码器。训练上,...

推荐理由:Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了,一个 30B 参数、专为本地 agent 工作流设计的模型。4-bit 量化后不到 20 GB,能在单张消费级显卡上跑,还留出显存给 KV cache 和视觉编码器。定位很明确——不是通用聊天模型,而是常驻本地的 agent 引擎。我会先打个折:目前只有发布博客的信息,没有第三方跑分和实际部署反馈,所以分数没往上拉。但开源协议、显存占用和本地 agent 这个组合,对自部署和隐私敏感场景确实有吸引力。

8月6日星期四

AI HOT 精选

阿里云发布 Qwen-Image-3.0,高分辨率生图起步价 0.03 美元

Qwen-Image-3.0 主打生产环境可用,能吞下 4500 个 token 的提示词,相当于一篇小作文。官方说文字准确率超过 100%,logo 不会出现乱码或破损,原生支持 12 种语言。高分辨率生图起步价 0.03 美元,按量付费。不过正文只给了标题和链接,没提模型架构、推理速度和具体跑分,这个准确率数字先别太当真,等第三方实测再说。

推荐理由:Qwen 第一个专门的图像生成模型,0.03 美元起步、4500 token 提示词上限、12 种语言支持,这几个点确实有区分度。分数没给更高是因为信息源只有一条推文,正文没披露模型架构、推理速度和第三方跑分,那个“>100% 文字准确率”的说法先打个折,等实测再看。

Product Hunt · AI

Mistral 发布 Shieldstral:一个 3B 开源多模态护栏,能在推理时用自然语言定义安全策略

Mistral 这周在 Product Hunt 上架了 Shieldstral,一个 30 亿参数的开源多模态安全护栏。你可以直接用大白话写安全规则,它就能同时检查文字、图片或混合内容,最后只吐一个 token 告诉你过还是不过。一张 16GB 显存的消费级显卡就能在本地跑起来。Product Hunt 页面给了基础介绍和截图,但没提具体延迟、准确率...

推荐理由:Mistral 扔了个 30 亿参数的多模态安全护栏出来,能本地跑,规则用人话写就行,对应用开发者很实用。但 Product Hunt 页面没给延迟和准确率数据,能不能直接上生产还得打个问号,所以分数没给更高。

AI HOT 精选

Simon Willison 用 Claude Fable 5 一次性生成了完整的《Raccoon Heist》3D 游戏

Simon Willison 把 2022 年的一条老推文和两张概念图丢给 Claude Fable 5,没再给任何指令,模型自己选型 Three.js、调用 OpenAI 的 gpt-image-2 生成贴图,做出了一个能在浏览器里玩的 3D 浣熊盗窃游戏。整个过程在手机上完成,通过 GitHub Pages 部署。游戏本身玩法还比较基础,但零人工干...

推荐理由:Simon Willison 的第一手实验本身就是质量信号。一条老推文加两张概念图,Claude Fable 5 自主搞定技术栈、贴图生成和部署,信息密度很高。没给更高分是因为游戏玩法还比较基础,正文也没披露生成过程的失败次数或修正轮数,实际稳定性存疑。

8月5日星期三

Hacker News 首页

Qwen 发布 Image 3.0 Pro:一次生成带小字、多图排版的复杂版面,生图价格每千张 4 美元

这个模型能一口气处理 4500 个 token 的输入,直接生成报纸、菜单、故事板这类信息密度很高的图,而且图里还能再套图。它能把文字稳定渲染到 10 像素那么小,支持 12 种语言和 20 多种字体,对皮肤毛孔、发丝、微表情的还原也接近照片质感。输出价格是 1K 图 0.04 美元,2K 图 0.075 美元,但每分钟只能请求 1 次,所以想跑大批量...

推荐理由:Qwen 这次给的规格很具体——4500 token 输入、图里套图、10 像素文字稳定渲染,不是画饼。0.04 美元一张 1K 图的价格有竞争力,但每分钟 1 次的请求限制直接把批量场景堵死了,所以分数上我会先打个折。对做海报、菜单、故事板的人来说,小字和多语言支持是刚需,值得上手测,但别指望拿来跑流水线。

Hacker News 首页

Mistral 发布 Shieldstral:一个 3B 参数、开放权重的多模态内容审核模型

Mistral 推出了 Shieldstral,一个 30 亿参数、开放权重的模型,专门用来检查文字和图片内容是否违规。它可以在本地或边缘设备上跑,负责审核用户输入和模型输出。官方博文没给跑分、延迟数据,也没提价格,只把它定位成一个安全过滤器。我会等第三方评测,但 3B 这个尺寸对于自己部署审核来说确实够轻量。

推荐理由:Mistral 发了个 Shieldstral,30 亿参数、开放权重,专门做图文内容审核,能在本地或边缘设备上跑。尺寸够轻量,对想自己搭安全过滤的团队是个新选项。但官方博文没给任何基准测试、延迟数据或价格,现在没法判断它实际好不好用——这点先别太激动,等第三方跑完分再说。

8月4日星期二

AI HOT 精选

商汤开源 SenseNova U1,一个模型同时搞定推理和出图

商汤放出了一个叫 SenseNova U1 的开源模型,把逻辑推理和图像生成塞进了同一条流水线。它能直接把一句提示词变成带图的结构化幻灯片,也能一步步边想边画,比如演示怎么分六步画出一条龙。模型代码和权重已经挂在 HuggingFace、GitHub 和 SenseNova Studio 上。正文没提参数量、训练数据和跑分,实际效果和资源消耗得自己试了...

推荐理由:商汤开源了 SenseNova U1,把推理和图像生成统一到一个模型里,给了几个具体 demo,不是只发个标题。但正文没提参数量、训练数据和跑分,实际能力上限没法判断,所以分数没给到 85 以上。不过权重和代码都放出来了,对开源社区是个实在的贡献,值得关注。

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

Latent Space

阿里通义千问发布 Qwen3.8-Max 和 27B,下周开源模型权重

阿里甩出了 Qwen3.8-Max,一个 2.4 万亿参数的超大模型,主打编程和长时间自主干活。官方说它能连续 10 多天自己写代码不崩,还能在 125 小时内独立跑完一套 AI 研究流程,最后效果比原论文的基准还高了 2.71 分。在模拟一整年经营的电商测试里,它赚了 4.16 倍的回报。API 价格是输入每百万 token 2 美元,输出 6 美元...

推荐理由:阿里这次放出的 Qwen3.8-Max 主打长时间自主干活,给的数字挺具体——125 小时独立跑研究、10 多天连续写代码、电商模拟回报 4.16 倍。我会先打个折,因为目前只有官方博客和 Latent Space 的二手报道,没有独立复现或第三方验证,所以分数没给到 95。但 2.4T 参数这个体量加上 agent 方向的明确指标,放在本周确实值得放在头条。

AI HOT 精选

欧盟 AI 透明度规则今天生效,不标 AI 内容最高罚 1500 万欧元

从今天起,在欧盟运营的科技公司必须给 AI 生成的文字、音频、视频和深度伪造内容打上标签,并告诉用户他们正在跟机器对话。违规罚款最高 1500 万欧元,或者全球年营业额的 3%。欧盟还发布了一套官方标签图标,公司可以直接用,不用自己设计。

推荐理由:这是欧盟 AI 法案透明度规则正式生效的日子,罚款上限明确,属于现有法规的执行节点而非新规出台。对在欧洲运营的 AI 公司和内容平台是直接的合规事件,HKR 三项都踩中,但因为是执行层面而非政策新增,所以重要性给到 78,放在 featured 里。

8月3日星期一

Computing Life · Share · 鸭哥调研

Google Earth 上线 AI 生图一天就撤下:界面承诺的信用,比水印跑得更远

2026 年 7 月 30 日,Google 在 Google Earth 里加了一个 AI 生成按钮,让用户能在真实卫星底图上用 Nano Banana 2 模型合成假想图,结果一天之内就紧急撤回了。问题出在截图分享上:用户把生成的假图截屏发到社交平台后,图片上的 AI 水印和元数据在转码压缩中基本丢光,但 Google Earth 二十年来作为“现...

推荐理由:Google Earth 加了个 AI 生图按钮,一天就撤,这事有反转、有细节,还有用户实测绕过审核的案例,三个维度都踩中了。没给更高分是因为这是一篇观点分析,不是官方产品发布,撤回动作本身也说明 Google 自己没准备好。

8月1日星期六

Hacker News 首页

探索式建模:给模型 K 次猜测机会,只拿最好的那次来训练

Alexi Gladstone 提出了探索式建模(XM),核心思路很简单:每一步让模型生成 K 个候选结果,然后只拿最好的那个来训练。这相当于在数据和参数量之外,给预训练增加了第三条可以扩展的轴。实验显示,增加探索次数能稳定提升图像、视频和语言模型的效果,而且模型规模越大,收益越明显——数据量增加时,提升从 7% 涨到 36%;参数量增加时,从 13%...

推荐理由:Alexi Gladstone 提了个叫探索式建模(XM)的方法,做法很直白:每一步让模型吐出 K 个候选结果,只挑最好的那个拿来训练。这相当于在堆数据和堆参数之外,给预训练多开了一个可以拧的旋钮。实验跨了图像、视频和语言模型,效果都稳得住,而且模型越大、数据越多,收益越明显——数据量上去后提升从 7% 蹿到 36%,参数量上去后从 13% 涨到 23%,还报了个 6.2 倍的效率提升。我会先打个折,因为作者是个人研究者,不是知名实验室,文章也是自述形式,没有经过同行评审,这点先别太激动。但思路本身够简单,有代码有项目页,值得认真看一眼。

FT · 科技

Google Earth 上线没几天的 AI 卫星图功能被紧急下架,因为它会凭空捏造建筑和道路

Google 在 7 月 31 日关掉了 Google Earth 里刚推出几天的“AI 卫星视图”。这个功能本意是用生成式 AI 把模糊的卫星照片变清晰,结果用户发现它会在真实地形上自己“脑补”出建筑、道路和车辆。Google 确认该功能“没达到质量标准”,已经下线,但没说具体是什么条件触发了模型胡编乱造,也没给修复时间。对地图这种必须讲事实的产品来...

推荐理由:这条新闻本身够硬:Google 旗舰产品翻车,FT 独家,有具体例子,不是通稿。我会先打个折,因为正文没披露模型在什么条件下开始胡编,也没给修复时间,信息缺口明显,所以重要性卡在 78 合理。三个推荐理由都成立:热点事件、技术教训、从业者共鸣,直接写出来就行。

TechCrunch · AI

Google 上线一天就砍掉 Earth AI 生图功能,BBC 记者当场演示它能造假新闻

Google 周四在 Google Earth 里接入了 Nano Banana 2 生图模型,让用户输入文字就能在真实卫星地图上叠加任意 AI 生成的图像。BBC 记者立刻发帖嘲讽,说这个功能简直是给假新闻配图的利器,并当场生成了几张看起来很真的灾难现场图。Google 周五就宣布撤回该功能,承认部分用户生成的截图违反了平台政策,需要在加入更强的防护...

推荐理由:我会先打个折:目前只有 BBC 记者一方的公开测试和报道,Google 的回应也比较简短,具体防护机制和违规比例都没披露。但这事本身够直接——Google 把 Nano Banana 2 塞进 Google Earth,让用户输入文字就能在真实卫星图上叠加任意 AI 图像,BBC 记者立刻生成几张逼真的灾难现场图,Google 第二天就撤了功能。对从业者来说,这比实验室里的红队测试更有说服力,因为它发生在亿级用户产品上,而且暴露的不是模型能力问题,是产品集成时根本没拦住显而易见的滥用。所以给 82 分,没再高是因为信息源单一,且撤回动作本身也算止损。

The Verge · AI

Google 地球里塞了个 AI 生图工具,已经能造出以假乱真的卫星照片了

Google 地球新出的“Dream House”功能,本意是让你用文字生成航拍风格的房屋图片。但安全研究员 Henk van Ess 发现,只要在提示词里加上“卫星视图”,就能绕过内容过滤器,生成非常逼真的假卫星图。Google 虽然加了水印和限制,但把关键词换成“航拍视图”照样能出图。更麻烦的是,这些假图被反向图片搜索收录后,会出现在第三方地图数据...

推荐理由:这事最麻烦的不是能生成假图,而是假图已经流出去了。研究员用一句提示词就绕过了 Google 的内容过滤器,生成的假卫星图被反向图片搜索收录后,直接出现在第三方地图数据里。Google 加了水印,但把关键词从“卫星视图”换成“航拍视图”照样出图,说明过滤机制没卡住语义。正文没披露 Google 后续会不会清理已收录的假图,这点先别太激动,但数据污染的链条已经跑通了。

7月30日星期四

The Verge · AI

xAI 赶在明尼苏达州反“一键脱衣”法生效前起诉,称 Grok 生成露骨图片是言论自由

明尼苏达州一项禁止用 AI 生成未经同意的假裸照的法律马上要生效,xAI 在最后一刻提起了诉讼。xAI 认为这条法律写得太宽泛,会连带限制 Grok 的图像生成功能,违反了第一修正案对言论自由的保护。在法庭文件里,xAI 把 Grok 描述成一个“有态度、爱讽刺”的 AI 助手,说它生成的露骨图片是一种表达形式。州总检察长反驳说,法律只针对未经同意的伪...

推荐理由:xAI 起诉明尼苏达州的反 AI 假裸照法,把 Grok 的图像生成能力绑上第一修正案的言论自由辩护,法律冲突很尖锐。分数没给更高是因为目前只是一纸诉状,法院还没判,实际影响要等后续进展。

7月29日星期三

The Verge · AI

艺术家们开始集体起诉 AI 公司,部分案件已熬过第一轮驳回动议

插画师、作家和音乐人正在对 Google、Meta、Anthropic 等公司提起版权诉讼。文章追踪了最近的案件进展:一些法院驳回了科技公司要求撤诉的动议,让官司得以继续推进。艺术家们对胜诉的信心比之前高了一些,但对 AI 的整体走向仍然悲观。正文没披露具体的赔偿金额或和解细节。

推荐理由:一篇版权诉讼进展的汇总,亮点在于法院驳回了科技公司撤诉的动议,让案子能继续打。艺术家信心涨了一点,但对 AI 整体走向还是悲观。我会先打个折:正文没给赔偿数字或和解细节,所以只能当趋势信号看,别当深度法律分析。

7月28日星期二

Hacker News 首页

Kimi K3 架构解读:2.8 万亿参数开源模型,全身都是为推理省钱的改造

Sebastian Raschka 拆解了刚发布的 Kimi K3 架构。这个 2.8 万亿参数的开源模型是从去年 48B 的 Kimi Linear 放大来的,目前是最大的开源权重模型。设计上几乎全在给推理阶段省成本:用 LatentMoE 把大线性层压缩起来,类似给模型瘦身;标准注意力换成了多头潜在注意力和 Kimi Delta 注意力;还把 Ro...

推荐理由:Raschka 把 Kimi K3 的架构拆得很细,重点全在推理阶段怎么省钱:用 LatentMoE 压缩大线性层、换掉标准注意力、还改了 RoPE 的用法。不是官方通稿,是工程师视角的解读,对实际干活的人参考价值大。没给更高分是因为这是第三方技术分析而非一手发布,部分读者可能觉得太硬。

The Verge · AI

Hugging Face 上架了一堆“一键脱衣”模型,专挑女性和儿童下手

The Verge 的调查发现,Hugging Face 托管了大量能生成裸照的模型,很多伪装成“换装”或“时尚编辑”工具,只需要一张照片就能输出裸体图像,目标直指女性和儿童。平台目前几乎没有系统级防护,也不会主动扫描上传的模型。Hugging Face 说自己靠人工审核举报,但正文没披露审核团队规模和响应时间。我会先打个折——平台确实有内容政策,但执...

推荐理由:The Verge 的调查揭露 Hugging Face 托管了大量能生成裸照的模型,伪装成换装工具,目标直指女性和儿童。平台没有主动扫描,只靠用户举报,但正文没写审核团队规模和响应时间,这点信息缺口让严重性打了折扣。H、K、R 全中,但缺具体审核数据,所以没给到 85 分以上。

7月27日星期一

AI HOT 精选

月之暗面把 Kimi K3 的模型权重、技术报告和三项基础设施技术一起公开了

Kimi K3 是一个 2.8 万亿参数的混合专家模型,也就是把任务分给不同专家模块处理,不用每次激活全部参数,能省算力。它原生支持图片理解,单次能处理 100 万 token 的上下文,相当于一次能读完《三体》三部曲还有余。团队说规模化效率比上一代 K2.5 提高了 2.5 倍,这个数字说明用同样资源能训出更强的模型,或者训同样水平的模型成本更低。同...

推荐理由:月之暗面把 Kimi K3 的权重、技术报告和 infra 技术一起开源了,2.8 万亿参数 MoE,单次能吞 100 万 token,规模化效率比上一代提升 2.5 倍。国内旗舰模型完整开源是强信号,热度、知识量、可复现性三条全中。没给更高分是因为目前只有标题和摘要,具体训练成本、消融实验、真实场景跑分都还没看到,等报告正文出来再调。

AI HOT 精选

Kimi 开源 K3 模型:2.8 万亿参数 MoE,原生支持图像和 100 万 token 上下文

Kimi 把自家最强的模型 K3 开源了。这是个 2.8 万亿参数的混合专家模型,不用外挂就能直接理解图像,单次能处理的上下文长达 100 万 token。官方说新架构让每单位算力产出的智能提升了 2.5 倍——打个折理解,就是同等算力下模型更聪明了。这次不光放出了模型权重,还一起开源了高性能注意力计算内核、MoE 通信库和一个大规模智能体运行环境。正...

推荐理由:月之暗面把K3完整开源,权重、内核、通信库、智能体环境全给,不是只扔个模型。2.8T MoE、100万上下文、原生视觉,外加2.5倍算力效率的说法,信号很强。没给更高分是因为技术报告刚出,实际效果和效率提升还没被第三方验证,先打个折看社区反馈。

7月26日星期日

Computing Life · Share · 鸭哥调研

27B 模型塞进 iPhone 了,现在该问它到底能干嘛

Bonsai 27B 把 Qwen3.6-27B 压到了约 1.125 bit/权重,在 iPhone 17 Pro Max 上运行时占用约 3.9 GB 内存,15 项思考模式测试平均分 76.11,保留了原模型约 89.5% 的能力,但看图(59.57 分)和工具调用(66.03 分)掉得比较厉害。另一条路是 MiniCPM-V 4.6,总参数量 ...

推荐理由:Bonsai 27B 把 27B 模型跑在 iPhone 上,还给了真实跑分,这标志着讨论从技术可行性进入了产品化阶段。文章没停在跑分上,而是拆解了四个工程瓶颈:内存、发热、视觉预填充和可靠性。不足是 MiniCPM-V 4.6 那边的数据没给全,但整体判断很清醒,值得推荐给在端侧做模型选型的人。

7月25日星期六

Computing Life · Share · 鸭哥调研

Netflix 用 AI 做了约 300 部片子,主要在后期,不是一键拍电影

Netflix 在 2026 年二季度股东信里说,大约有 300 个片目用上了生成式 AI 的工作流,大头在后期制作。电话会议补充了具体用法:场景参考、镜头规划、预演和视觉特效。在《The American Experiment》里,17 分钟 AI 增强画面的制作速度大概是之前方案的两倍,成本降了一半——这只是个案,不能当成行业规律。Netflix ...

推荐理由:Netflix 首次披露 300 个片目用上生成式 AI,还拆了具体工作流和一个个案数字,HKR 全中。但个案不能推广,正文也没说 300 个片目占总量的比例、'片目'怎么定义,所以分数卡在 78,刚好进 featured。

Hacker News 首页

Anthropic 发布 Claude Opus 5 系统卡:代理编程和长任务能力大幅提升,对齐评分创下新高

Claude Opus 5 是 Opus 4.8 的升级版,主要提升在代理编程、操控电脑和长链条知识工作上,数学和科学推理也有进步。Anthropic 评估其整体对齐风险为“非常低”,模型没有跨过自动 AI 研发或新型生物武器的能力门槛。在自动化行为审计中,它的对齐得分超过了 Sonnet 5、Opus 4.8 和 Mythos 5,尤其遵守内部准则的...

推荐理由:Anthropic 发 Claude Opus 5 系统卡,是旗舰模型发布。文章给了对齐审计分数的具体排名和 RSP 风险判断,信息密度够,不是空话。但没放绝对 benchmark 数字,也没提价格,所以到不了 95 分。整体是安全侧的重要更新,从业者会存下来当参考。

7月24日星期五

Hacker News 首页

FLUX 3 开始控制机器人:一个模型同时生成视频和预测动作

Black Forest Labs 把早期版 FLUX 3 装到了 mimic 的机器人上,已经在奥迪产线做过测试。FLUX 3 是一个模型同时生成图像、视频和音频,其中视频预测占了训练算力的 95% 以上。为了不出现画面穿帮,模型必须学会接触、运动和因果关系。把动作预测作为低维模态加进去时,视频质量一度掉了 10%,但训练 3500 步后就完全恢复。...

推荐理由:Black Forest Labs 把早期版 FLUX 3 装到 mimic 机器人上,在奥迪产线做了测试。一个模型同时出图像、视频和音频,其中视频预测占了训练算力的大头。为了画面不穿帮,模型得学会接触和因果,把动作预测当低维模态加进去时视频质量一度掉了 10%,但 3500 步就恢复。跨模态加物理部署加具体数字,三条都踩中了。没给更高分是因为正文没披露测试规模、成功率或产线具体任务细节,我会先打个折。

AI HOT 精选

Black Forest Labs 发布 FLUX 3,一个模型搞定图像、视频和音频,一次能生成 20 秒带声音的视频

FLUX 3 用统一架构把图像、视频和音频放在一起学,不再拆成几个模型拼凑。它一次能输出最长 20 秒的视频,并且自带原生音频,支持文生视频、图生视频、视频续写、关键帧转视频和多镜头串联。在带声音的 10 秒 720p 视频人工评测里,FLUX 3 赢 Grok Imagine Video 的概率是 69%,对比 Seedance 2.0 和 Gemi...

推荐理由:Black Forest Labs 发了 FLUX 3,一个统一的多模态模型,能直接出最长 20 秒带声音的视频,不是老路子的图像模型加个音频插件。69% 的胜率对比 Grok Imagine Video 给了它一点底气。没给 85 分是因为正文没提公开测试或第三方实测,实际效果还得等上手。

The Verge · AI

Claude 的语音模式现在支持 Opus 和 Sonnet,还能读你的 Gmail 和 Slack

Anthropic 把语音模式从 Haiku 扩展到了 Opus 和 Sonnet,三个模型现在都能用语音交互了。更实际的变化是,语音模式可以接入 Gmail、Slack 这类应用,直接读出你的邮件和消息。不过正文没提延迟和准确率数据,实际体验好不好用,建议等上手测试再说。

推荐理由:Anthropic 把语音模式铺到了 Opus 和 Sonnet,还接上了 Gmail、Slack,实用性和话题性都有。但正文没给延迟和准确率数据,实际体验得等上手,所以分数压在 80 以下。

7月23日星期四

AI HOT 精选

谷歌把 Gemini 3.6 Flash 和 3.5 Flash-Lite 转正了,更便宜也更省 token

谷歌正式发布了 Gemini 3.6 Flash 和 3.5 Flash-Lite,两个模型都支持 100 万 token 的上下文窗口和 6.4 万 token 的最大输出。3.6 Flash 的定价是每百万输入 token 1.5 美元、输出 7.5 美元,比 3.5 Flash 便宜,官方说它在处理复杂的智能体任务和多模态任务时,用的推理步骤、对...

推荐理由:谷歌发了 Gemini 3.6 Flash 正式版,定价比 3.5 Flash 便宜,还强调在智能体和多模态任务上用了更少的推理步骤。有具体价格和规格,但正文没给基准测试或跟竞品的对比,所以重要性给到 78。

7月22日星期三

AI HOT 精选

实测通义千问图像模型 3.0:中文长文字不崩、多图融合能打,跟 GPT Image2 有来有回

阿里放出了 Qwen-Image-3.0,一次能塞 4.5k token 的指令,支持 12 种语言和 20 多种字体。作者拿它跑了 19 个场景,包括中文长文本、多语言混排、UI 界面、多图融合和图片编辑。结果文字基本不花,信息也对得上,画质跟 GPT Image2 差不多。国内直接能用,速度不慢,价格也不算贵,但正文没给出具体价格和延迟数字。

推荐理由:作者拿Qwen-Image-3.0跑了19个场景,中文长文本、多语言混排、UI界面、多图融合都测了,文字基本不花,画质跟GPT Image2差不多。对比做得挺实在,不是公关稿。扣分是因为正文没给出具体价格和延迟数字,想算成本的人还得自己去查。

Hacker News 首页

让 GPT-5.6、Claude、Gemini 和 Grok 用彩色铅笔“画”蒙娜丽莎

TryAI 搭了个画布擂台,给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 一套彩色铅笔工具,让它们照着蒙娜丽莎和星月夜两张图复刻,外加五道开放命题作画,一共跑了 28 幅。模型可以自己选颜色、笔尖粗细、下笔力度,还能涂抹、擦除、随时看一眼画布再改。GPT-5.6 Sol 在结构相似度(...

推荐理由:TryAI 搭了个画布擂台,给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 一套彩色铅笔工具,让它们照着蒙娜丽莎和星月夜复刻,外加五道开放命题,一共跑了 28 幅。模型可以自己选颜色、调笔尖粗细、控制下笔力度,还能涂抹、擦除、随时看一眼画布再改。GPT-5.6 Sol 在结构相似度上领先,但每笔成本也最高;Gemini 3.6 Flash 便宜但细节糊成一团。这个测试把“工具调用 + 视觉反馈”的差距直接摊在画布上,比跑分直观得多。

AI HOT 精选

Google 发了三款新 Gemini 模型,但旗舰 3.5 Pro 还是没影

Google DeepMind 一口气放出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。3.6 Flash 是新的主力,写代码和处理多模态任务更强,token 消耗最多能降 17%,比上一代 3.5 Flash 更便宜。3.5 Flash-Lite 主打极致低成本,3.5 Flash Cyber ...

推荐理由:Google DeepMind 一次放出三款 Gemini 模型,3.6 Flash 当新主力,写代码和多模态能力有提升,token 消耗最多能降 17%,比 3.5 Flash 更便宜——这对开发者是实打实的成本信号。3.5 Flash-Lite 走极致低价路线,3.5 Flash Cyber 加了安全防护,定位清楚。但正文没提 3.5 Pro,缺了大家最想比的那块拼图。分数没给满,因为 TechCrunch 这篇信息量有限,很多技术细节和实测对比没展开。

7月21日星期二

Google DeepMind

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。

推荐理由:原文给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型变化。

7月17日星期五

Hacker News 首页

月之暗面发布 2.8 万亿参数 Kimi K3,自称首个开源 3T 级模型,API 定价看齐 Claude Sonnet

月之暗面推出了 Kimi K3,一个 2.8 万亿参数的模型,他们把它四舍五入叫成“首个开源 3T 级模型”。这个模型 API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。它自己公布的跑分大多超过了 Claude Opus 4.8 和...

推荐理由:月之暗面发了 Kimi K3,一个 2.8 万亿参数的模型,他们管它叫“首个开源 3T 级模型”,API 定价输入每百万 token 3 美元、输出 15 美元,跟 Claude Sonnet 一个价,是目前中国 AI 实验室里最贵的。自己公布的跑分大多超过 Claude Opus 4.8 和 GPT-5.5 high,但输给 Claude Fable 5 和 GPT-5.6 Sol。Simon Willison 的测试里 K3 在长周期知识任务上比前代 K2.6 涨了 732 Elo,输出 token 数少了 21%,成本降了 27%,说明模型在...

Sinocism · 比尔·毕晓普

WAIC 开幕前,中国推动 AI 新秩序,Kimi 发布开源大模型

世界人工智能大会(WAIC)开幕前一天,两条消息撞在一起。一是习近平设欢迎晚宴,王毅与 29 国代表签协议,要成立“世界人工智能合作组织”。央视账号玉渊谭天发文解释,中国想探索另一种 AI 秩序:开源、全要素共享,打破闭源模型和算力限制造成的技术依赖。二是月之暗面发布 Kimi K3,一个 2.8 万亿参数的开源模型,支持 100 万 token 上下...

推荐理由:WAIC 开幕前一天,两条消息撞在一起。一是习近平设欢迎晚宴,王毅与 29 国代表签协议,要成立“世界人工智能合作组织”。央视账号玉渊谭天发文解释,中国想探索另一种 AI 秩序:开源、全要素共享,打破闭源模型和算力限制造成的技术依赖。二是月之暗面发布 Kimi K3,一个 2.8 万亿参数的开源模型,支持 100 万 token 上下文。政策信号和产品发布同一天出现,时间点本身就值得讨论。有具体新事实:29 国签协议成立 AI 合作组织,明确提“开源、全要素共享”作为另一种 AI 秩序;Kimi K3 是 2.8 万亿参数的开源模型,支持 100 ...

AI HOT 精选

xAI 不再嘴硬说 Grok 不会生成儿童性虐待图像,转而起诉用户

xAI 第一次起诉了一名用 Grok 生成儿童性虐待图像的用户。公司之前一直说这种内容是用户自己搞出来的,但这次起诉等于变相承认模型确实能被用来产出非法内容。文章没提具体用了什么安全措施、哪个模型版本,也没说有多少用户受影响。这看起来更像是法律层面的止损操作,而不是技术上的修复。

推荐理由:xAI 第一次起诉用户用 Grok 生成儿童性虐待图像,这等于在法律层面承认模型能被滥用,之前公司一直说内容是用户自己搞出来的。文章没写具体安全措施、模型版本和受影响用户数,所以分数压在 85 以下。但这件事从口头否认变成法律止损,对行业来说是个信号,我会先打个折,等更多技术细节出来再调整。

7月16日星期四

Latent Space

Lila Sciences 想把实验室变成数据中心,让 AI 24 小时不停做实验

Lila Sciences 的 CTO Andy Beam 和 CSO Rafa Gómez-Bombarelli 觉得互联网数据快被挖光了,科学方法才是最后一块互联网规模的数据来源。他们把实验室当成一个无限生成数据的机器:用强化学习提假设,让自然界来验证。目前他们已经产出了超过 10 万亿个经过实验验证的科学推理数据点。他们的自动化实验室用视觉语言模...

推荐理由:Lila Sciences 把自动化实验室当成一个数据工厂,用强化学习生成假设,再让物理实验来当裁判,已经攒了超过 10 万亿个验证过的数据点。这个思路对 AI 从业者来说很新鲜,因为它把“数据枯竭”这个焦虑引向了一个具体的解法。不过内容本身是播客访谈,没有可复现的论文或开源代码,所以我会先打个折——想法很硬,但落地细节和可验证性还差一口气。

AI HOT 精选

天工短剧工作台上线导演Agent和无限画布,自动拆剧本、定机位,解决AI短剧角色乱跑和变脸问题

天工短剧工作台这次放出了两个东西:一个叫导演Agent,能自动把剧本拆成分镜,规划演员站位和镜头角度,同时生成多视角的细节图,专门解决AI短剧里角色脸变来变去、位置漂移的老毛病。另一个是无限画布,配合内置的影视级提示词模板、720°全景图和3D导演台,让制作过程更可控。他们已经有3部作品在海外短剧平台DramaWave上线,7天营收破百万美元。不过正文...

推荐理由:天工短剧工作台放出了导演Agent和无限画布,直接打AI短剧角色一致性的老毛病。Agent能自动拆分镜、定站位和镜头角度,还生成多视角细节图,不是单纯换提示词。三成作品在DramaWave上线,7天营收破百万美元,商业上已经跑通了。不过正文没给技术细节和一致性量化指标,这点先别太激动,等更多作品出来再看。

The Verge · AI

xAI 起诉一名用户,指控他用 Grok 生成儿童性虐待材料的深度伪造图

马斯克的 xAI 向联邦法院起诉了 Terry Harwood,说他绕过了 Grok 的安全护栏,用“提示词注入”之类的手段生成了儿童性虐待材料(CSAM)的深度伪造图。这是 AI 公司主动起诉用户生成违法内容的罕见案例,但报道没披露他具体用了什么技术、生成了多少张图。xAI 在诉状里要求赔偿名誉损失和法律费用,不过这种“用户滥用模型”的官司,能不能真...

推荐理由:xAI 起诉用户用 Grok 生成 CSAM 深度伪造图,是少见的 AI 公司追着终端用户打的案例。话题够硬,但正文没披露具体技术手段和生成数量,事实密度偏薄,所以分数没往上拉。