跳到正文

#产品更新

今日 22 条

6月5日星期五

AI HOT 精选

OpenAI 在生成接口里直接返回内容审核分数,不用再单独调一次审核接口

OpenAI 把内容审核评分塞进了 Responses API 和 Completions API 的返回结果里。你现在发一次请求就能同时拿到生成内容和对应的安全分数,不用像以前那样先调生成接口、再调审核接口。拿到分数后,你可以自己决定怎么用:记日志、做路由分发、人工复核,或者直接拦截。正文没披露这个审核模型的延迟会增加多少、准确率怎么样,也没说和独立...

推荐理由:HKR-K 和 HKR-R 都成立:OpenAI 把审核分数塞进生成响应里,开发者可以据此做路由和拦截,省掉一次单独审核调用的开销。HKR-H 偏弱,因为这只是公开信和功能更新,不是已生效的法律或硬性安全突破,所以放在 featured 档位。正文没给出法案文本和执行时间表,实际省钱效果还得看调用量和审核精度,但方向上是给安全管线减负。

TechCrunch · AI

苹果首次放行 AI 代理进 iMessage 商家聊天,Poke 拔得头筹

苹果批准了 Poke 接入 Messages for Business,这是该平台第一个能直接跟用户发短信干活的 AI 代理。Poke 本身做的就是让用户通过短信使唤 AI 助手,这次相当于把它的服务嵌进了苹果官方的商家消息通道。不过正文没披露苹果的审核标准是什么、这次开放的范围有多大,也没提商业分成怎么算。

推荐理由:HKR-H/K/R 都过,但正文很薄:只确认了 Poke 获批和“首个”身份,没给出审核规则、铺开节奏或商业条款。这更像一条门槛级的产品动态,够 featured,但信息密度撑不起 78 分以上的段位。

AI HOT 精选

Codex 加了个 iOS 应用构建插件,不用切窗口就能预览和改代码

OpenAI 给 Codex 接入了 Build iOS Apps 插件,现在你可以在 Codex 的内置浏览器里直接跑 iOS 应用、打开 SwiftUI 预览,改完代码也能热重载,不用来回切换工具。正文没提这个插件是官方做的还是第三方贡献的,也没说支持哪些 iOS 版本或设备型号。

推荐理由:HKR 三项都过:钩子是 Codex 直接处理 iOS 应用测试,有 SwiftUI 预览和热重载这些具体细节。但这是一封公开信和政策呼吁,不是已生效的法律,正文也没给出法案文本和执行时间表,所以放在 featured 而不是更高。

AI HOT 精选

Replit Agent 接入 Shopify,描述卖什么就能自动搭好一个独立站

Replit 和 Shopify 打通了:用户在 Replit Agent 里说一句想卖什么,Agent 会直接生成自定义店铺页面、创建 Shopify 商店并上架商品。建完去 Shopify 认领店铺、设好支付就能开卖。正文没提收费方式、支持的地区和具体上线时间,如果是真的,对想快速试水电商的人挺省事。

推荐理由:HKR 全过:Shopify 打通流程对开发者有实感,但这是公开信和政策呼吁,不是已生效法律,法案文本和执行时间表都缺失,所以停在 featured 档。判断挂在信息缺口上——没提收费和地区,省钱与否得等后续。

AI HOT 精选

Boson AI 和 LMSYS 把 Higgs Audio v3 TTS 跑在了 SGLang-Omni 上,一个 4B 参数的语音合成模型,主打低延迟...

Higgs Audio v3 TTS 是 Boson AI 的语音合成模型,参数量大约 4B,底层用了 Qwen3-4B。它支持 100 种语言,在内部测试集上词错率/字错率能压到个位数。这个模型专门为语音助手那种边说边生成的场景设计,不等句子结束就能开始合成,后续文本到了还能保持声音、情绪和节奏连贯。开发者可以直接在输入文本里插标签来控制 20 多种...

推荐理由:H 和 K 靠 4B/100 语言/流式合成这几个硬指标撑住。R 偏弱,因为文章没给延迟、定价和权重,更像一个能力宣告而非可立刻复用的发布,所以放在 featured 低位。

6月4日星期四

AI HOT 精选

neolab 发布 Nex-N2-Pro,一个 397B 参数的混合专家推理模型,跑分自称摸到 GPT-5.5 水平

这个模型基于 Qwen3.5-397B-A17B 改造,总参数量 397B,用了混合专家架构(MoE,把任务分给不同子模型处理,省算力)。它能处理 26 万多字的长上下文,也支持图像识别。官方说它在 Terminal Bench 2.1、GDPVal、SWE-Verified 这几个测试集上拿了最高分,性能对标 GPT-5.5 和 Claude Opu...

推荐理由:HKR 三项都过:标题的 benchmark 钩子够强,正文也给了模型尺寸、上下文和 token 缩减的具体数字。但这是一封公开信和政策呼吁,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高。

r/LocalLLaMA

英伟达放出 Nemotron-3-Ultra 超大 MoE 模型,550B 总参数但只激活 55B,最低要 8 张 H200 才能跑

英伟达在 Hugging Face 上发布了 Nemotron-3-Ultra-550B-A55B-BF16,一个混合专家(MoE)模型。总参数量 550B,但每次推理只激活其中 55B 参数,相当于用 55B 模型的算力去撬动大得多的知识容量。上下文窗口拉到 1M token,能一口气处理很长的文档。硬件门槛不低,官方列的最低配置是 8 张 H200...

推荐理由:这条消息干货集中在规模和硬件门槛上:550B 总参数、55B 激活、100 万 token 上下文,最低 8×H200 或 16×H100。我会先打个折——正文没给任何基准测试分数、许可证细节和具体开放时间,所以没法判断实际效果和可用性。亮点是硬件要求本身就是一个筛选器,能直接筛出一批会认真评估的人。缺点也明显:没有性能数据,光看参数和上下文长度,只能说明“理论上能处理很长的内容”,但不知道推理质量怎么样。这点先别太激动。整体属于有信息量但缺验证的发布,适合放进 featured 提醒大家关注后续评测。

Hacker News 首页

Infracost 做了个本地工具,让编程助手在写基础设施代码时就能看到云成本,实测能省 67% 的 API 费用

Infracost 发布了 Cost.dev,一个本地命令行工具,可以嵌进 Claude Code、Cursor 这类编程助手的流程里。它的核心作用是:在你让 AI 写云资源代码(比如 Terraform)的时候,实时告诉你这套配置每个月要花多少钱,并给出省钱建议。他们拿裸用 Claude 做基准测试,结果显示这个工具能让模型输出的 token 量减少...

推荐理由:Infracost 发了个本地命令行工具 Cost.dev,专门给写代码的 Agent 做云成本估算,核心卖点是让模型输出更省 token、调用更省钱。他们给出的数字挺好看:Claude 输出 token 最多降 79%,API 成本最多降 67%。我会先打个折——这是厂商自己的数据,没有第三方验证,实际效果得看具体场景和 Agent 的实现方式。但思路本身是实用的,直接在本地跑,不依赖外部服务,对控制 Agent 的 API 支出和云资源浪费有直接帮助。正文没披露支持哪些云平台、和现有 CI/CD 流程怎么集成,这些信息缺口让实用性打了一点折扣。...

新智元 · 公众号

分子之心发布 MMDesign,声称靶点命中率超过 90%

分子之心推出了一个叫 MMDesign 的 AI 平台,专门用来从头设计生物大分子药物。他们在 12 个治疗靶点上做了测试,每个靶点只挑了 14 到 50 个分子去做湿实验验证,结果有 11 个靶点都测出了特异性结合,算下来靶点成功率超过了 90%。不过正文因为访问环境异常没加载出来,具体用了什么模型架构、训练数据规模、以及和哪些国际顶尖模型做了对比,...

推荐理由:我会先打个折:正文没披露这 12 个靶点具体是什么、难度如何,也没说湿实验的具体指标和对照组,所以 90% 这个数先别太激动。但亮点在于,每个靶点只筛了 14 到 50 个分子就进湿实验,如果数据属实,意味着前期筛选成本压得很低。对做 AI 制药的人来说,这比跑分更有参考价值。整体偏产品发布,但数字够具体,放在 featured 档合理。

AI HOT 精选

微软 AI 负责人说 Anthropic 模型太贵,正在自己搞更便宜的替代品

微软 AI 负责人 Mustafa Suleyman 公开说 Anthropic 的模型成本太高,公司已经在开发内部替代模型来降本。他没透露具体模型名称、能便宜多少、什么时候上线。这件事的背景是微软一边给 OpenAI 投了几百亿美元,一边还在大量采购别家模型当备选,现在连备选都觉得贵了。正文没披露自研模型是基于开源方案还是完全从头训,也没说性能对标的...

推荐理由:HKR三项都过了。微软点名Anthropic贵,自己下场做便宜替代,这个动作本身就够抓眼球。但正文缺了关键信息——模型叫什么、能便宜多少、什么时候能用,这些都没说,所以分数先打个折,放在featured里偏低的位置。

机器之心 · 公众号

谷歌放出 Gemma 4 12B,120 亿参数模型能在 16G 显存的笔记本上跑

谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...

推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。

机器之心 · 公众号

办公室都在用嘴打字,敲键盘快成老手艺了

这篇文章本身没加载出来,微信页面显示环境异常需要验证,所以正文内容我没看到。从标题和已有的英文摘要看,讲的是 AI 语音输入工具正在进入办公和开发场景。Wispr Flow 这个产品全球下载量超过 250 万,12 个月留存率 70%,年用户增长 100 倍,说明用的人确实在猛增,而且用了就回不去。OpenAI 的 gpt-4o-transcribe ...

推荐理由:HKR 三项都站得住,但这是一篇带数据的工作流趋势观察,不是模型发布或平台级更新,放在 featured 里属于门槛线附近的那一类。我会先打个折,不把它当硬核技术突破看,但“打字正在变古老技艺”这个判断加上 250 万下载和 70% 留存,确实能让人重新想一遍语音交互的落地速度。

The Verge · AI

亚马逊给仓库机器人 Proteus 加了语音交互,工人可以直接用自然语言派活

亚马逊发布了新版 Proteus 仓库机器人,核心变化是工人不用再通过专用软件下指令,直接说话就能给它派任务,像跟同事沟通一样。Proteus 最早在 2022 年亮相,外形像个大号扫地机,负责在仓库里搬重货、推大车。这次升级主要是交互方式从代码/软件切到了自然语言,但正文没披露具体部署了多少台、单台成本多少,也没说语音指令在嘈杂仓库里的准确率怎么样。...

推荐理由:我会先打个折:Amazon 只说了 Proteus 能听懂人话,没给任何规模数据,所以重要性卡在 featured 门槛附近。亮点是交互方式从编程界面直接跳到口语对话,对一线工人上手门槛降得明显;但没披露部署量,效果和稳定性都还是未知数。如果是真的跑通了,省培训成本、提响应速度都说得通,这点先别太激动。

AI HOT 精选

ChatGPT 推出 Dreaming 记忆系统,能自动从聊天记录里提炼你的偏好,不用每次都重新自我介绍

OpenAI 给 ChatGPT 换了一套叫 Dreaming 的记忆架构,核心变化是模型会在后台自动翻看你的历史对话,把零散信息合成一个关于你的“记忆摘要”,而不是只靠你手动让它“记住”某件事。官方说这能解决旧版记忆容易过时、记不全的问题,让 ChatGPT 在跨对话时更懂你的偏好和长期项目。目前这个更新只对美国的 Plus 和 Pro 用户开放,免...

推荐理由:OpenAI 给 ChatGPT 加了个叫 Dreaming 的记忆系统,核心是跨对话记住你的偏好,让聊天更连贯。这事有热度,因为名字和“长期记住你”这个点本身就自带话题,隐私这根弦也绷着。但正文没披露默认开关状态、保留周期和推送范围,这些关键信息缺了,所以重要性先打个折,定在 84。

AI HOT 精选

Hugging Face 改造命令行工具,让 Claude Code 这类编码智能体调用时省下 6 倍 token

Hugging Face 把自家的 hf 命令行工具重新设计了一遍,让它能同时服务人类和编码智能体。工具会通过环境变量自动识别是不是 Claude Code、Codex 等智能体在调用,如果是,就输出紧凑、不截断的 TSV 格式,而不是给人看的表格。在复杂多步任务测试里,没用这个 CLI 的智能体(比如自己拼 curl 或调 Python SDK)消耗...

推荐理由:我会先打个折:token 降到六分之一是官方说法,正文没给出测试场景和对比基准,实际省多少要看具体任务。但思路很清晰——传统 CLI 输出对人类友好,对智能体却是噪音,切成结构化 TSV 能减少大量解析和截断开销。自动检测智能体身份这一点也实用,不用手动切模式。整体是工具链层面的务实改进,不是模型或平台级发布,所以放在 featured 档合理。

r/LocalLLaMA

有人把折叠屏手机改成了跑本地模型的节点,用 Vulkan 加速

Reddit 用户 GsxrGuy80s 拿一台 Z Fold 6 当 GGUF 推理节点,走 Vulkan 加速,搭配 LiteLLM 和 Tailscale 组网。帖子公开了 gpu_layers=89 这个关键参数,说明把 89 层模型计算都扔给了手机 GPU。节点对外暴露 OpenAI 兼容接口,还设了 fallback 路由,请求搞不定就自动...

推荐理由:一个 Reddit 用户把折叠屏手机改成了本地大模型推理节点,用 Vulkan 驱动 GPU 加速,跑 GGUF 格式的模型,再通过 LiteLLM 统一接口、Tailscale 组网,让其他设备也能调用。帖子给了 gpu_layers=89 这个关键参数,还说明了模型崩了怎么自动切到备用路由。我会先打个折:这只是个人分享,没做压力测试,也没披露实际推理速度和功耗,稳定性存疑。但如果是真的,这种把闲置手机当推理节点的玩法挺省钱,也避开了云服务的隐私顾虑。对想自己折腾本地推理的从业者来说,这套组合拳(Vulkan+GGUF+LiteLLM+Tails...

AI HOT 精选

Anthropic 用 Claude 把 95% 的业务取数需求自动化了,准确率约 95%

Anthropic 公开了他们内部用 Claude 做自助数据分析的整套方案。核心思路是让非技术同事直接用自然语言问业务数据问题,系统自动查表、写 SQL、出结果。他们搭了一个三层架构:底层是数据基础层,负责把分散的业务指标统一成模型能读懂的语义;中间是验证工作流,专门处理模糊提问、过期数据和查不到的情况;上层是技能模块,让 Claude 学会按公司规...

推荐理由:我会先打个折,这是官方博客,数字肯定挑好看的讲。但 95% 自动化加约 95% 准确率,配上数据层、验证和 skills 这套 agentic analytics stack,确实把怎么做说清楚了。没有新模型或产品发布,所以分数在 72–77 这个区间。正文没披露错误类型的具体分布和延迟数据,这点先别太激动。

Latent Space

微软 CEO 纳德拉对谈:把 AI 做成生态,别只盯着一两个模型

纳德拉在 Build 大会的播客里聊了微软的 AI 思路,核心是把 AI 当成一个生态平台来做,而不是押注单个模型。他举了比尔·盖茨那条老原则:平台创造的价值得远超平台自己赚走的。微软这次主推的 MAI 系列模型,强调从预训练阶段就保证数据干净、可追溯,因为现在很多开源模型在榜单上看着漂亮,实际用起来不行。有意思的是他们拿一个 50 亿参数的小模型做“...

推荐理由:HKR 三项都踩中了:Satya 本人就是流量钩子,文章给出了微软企业级多模型平台的具体组件名,还透露了 5B 小模型用 traces 做 hill climbing 的机制,对从业者判断技术路线有参考价值。不过它终究是 Build 大会的访谈,不是独立模型发布,所以 78 分合理。

Hacker News 首页

谷歌发布 Gemma 4 12B:一个去掉独立图像编码器的多模态模型

谷歌在官方博客宣布了 Gemma 4 12B,主打“统一、无编码器”的多模态设计。简单说,它不再像传统模型那样给图片单独配一个视觉编码器,而是让同一个模型直接处理文字和图像。博客里没给架构细节、训练数据、基准跑分、定价和开源协议,只提了一句“能在笔记本上跑高性能多模态智能”。这点先别太激动——12B 参数在笔记本上跑通常需要量化或剪枝,但正文没披露用了...

推荐理由:Google 发了 Gemma 4 12B,说它是统一的无编码器多模态模型,意思是不再单独接一个视觉编码器,结构上更省事。但这条消息目前只有标题和 HN 讨论热度,正文没披露参数量怎么分配、训练用了什么数据、推理成本降了多少,也没给任何跑分。我会先打个折,把它放在 80 分上下,因为钩子够强,但事实太少,不值得冲太高。

6月3日星期三

r/LocalLLaMA

谷歌放出 Gemma 4 系列,12B 模型能看图文、听音频,上下文窗口拉到 256K

谷歌 DeepMind 把 Gemma 4 系列的开源权重挂上了 Hugging Face,一共五个尺寸。其中 12B 这个版本支持文本、图片和音频三种输入,同时放出了指令微调版和预训练版。它原生支持系统提示词和函数调用,上下文窗口最长能到 256K token,意味着一次可以塞进很长的文档或对话记录。不过 Reddit 原帖被网络策略拦截,正文没披露...

推荐理由:Gemma 4 这次把开放权重、多模态和 256K 长上下文一起端上来,比常规版本更新更有看头。我会先打个折:正文没给具体 benchmark 和 license 细节,官方博客也没同步,所以判断先停在 83 分。如果是真的,12B 这个尺寸能跑图、能听音频,对本地玩家挺省钱。

AI HOT 精选

Meta 把 AI 客服机器人推到了全球 WhatsApp Business 商家手里

Meta 正式在全球上线 WhatsApp Business 的 AI 客服机器人,叫 Meta Business Agent。它能自动回消息、推商品、约时间、筛销售线索,搞不定再转人工,Instagram 私信里也能用。收费按模型 token 消耗算,但具体价格和用的哪个模型,正文没披露。另外还在小范围测一个功能,让机器人每天早上给你总结前一晚的聊天重点。

推荐理由:Meta 把 AI 智能体塞进 WhatsApp Business 并全球铺开,等于让商家直接在聊天里接客、推销、处理售后。收费按 token 算,说明 Meta 想从对话量里抽成,但具体多贵、用的什么模型、哪些国家能用,正文全没写。我会先打个折:全球上线听着热闹,没价格和模型细节,商家算不了账,从业者也判断不了实际成本。这点先别太激动,等单价出来再看是不是真省钱。

OpenAI News

OpenAI 给 GPT-Rosalind 加了新能力,专攻药物研发和基因组学

GPT-Rosalind 是 OpenAI 为生命科学做的模型,这次更新接入了 GPT-5.5 的编程和工具调用能力,重点强化了药物化学、基因组学这些方向的推理。OpenAI 还专门搞了个叫 LifeSciBench 的评测,从证据处理、实验设计到结果验证六个环节打分,说新版模型在行业专家出的题上表现有提升。但正文没披露具体参数量、定价和普通用户能不能...

推荐理由:OpenAI 这次更新把 GPT-Rosalind 往生物和药物化学方向推,垂直落地的意图很清楚,所以重要性和行业信号都够。但正文没披露任何硬指标——参数多少、评测怎么做的、开放给谁用,全是空白,这点先别太激动。实验室场景天然带安全和合规风险,加上垂直模型抢地盘的话题,话题性也拉满了。综合看,信号强但证据弱,维持 featured 门槛没问题。

AI HOT 精选

微软 Build 2026:生图超谷歌,推理还在追

微软在 Build 2026 一口气发了七个自研模型,头一回做推理模型 MAI-Thinking-1。这是个万亿参数、每次激活 350 亿的大家伙,上下文窗口 12.8 万 token,专啃多步指令和代码。内部盲测说比 Anthropic 的 Sonnet 4.6 更受偏爱,但看公开跑分,大概跟 DeepSeek V3.2 打个平手。微软强调模型是从干...

推荐理由:微软在 Build 2026 上发了 7 个自研模型,图像生成直接对标 Google 并声称超越,推理模型则明确说还在追赶。同时公布了一种新调优方法和一个后台自主智能体。正文没披露具体模型名称、基准分数和开放时间,所以信息有冲击力但缺验证细节,重要性给到 84 是合适的,先别急着当定论。

Latent Space

微软一口气发了7个新模型,MAI-Thinking-1是主打,还附了109页技术报告

微软在Build大会上发布了7个MAI系列模型,覆盖文本推理、代码、图像、语音转文字和语音合成。主角是MAI-Thinking-1,一个35B活跃参数的混合专家模型,支持256K上下文窗口。它被定位为微软首个推理模型,训练数据链条干净,没有用任何第三方模型做蒸馏。随模型一起公开的109页技术报告在圈内评价很高,因为透明度给得足。报告里写明,模型的推理能...

推荐理由:我会先打个折:微软这次没公开模型权重、定价,也没给第三方评测结果,所以没法验证它实际有多强。但光凭 7 个模型、35B 激活参数的 MoE、256K 上下文和 109 页技术报告这几个硬数字,信息密度已经够高。加上这事发生在 Build 大会,直接摆在微软自家模型和 OpenAI 依赖的交叉点上,话题性拉满。正文没披露具体 benchmark 分数,这点先别太激动,但作为当天新闻,重要性给到 87 是合理的。

量子位 · 公众号

Papers with Code 复活了,Hugging Face 用 AI 代理把论文和排行榜重新串了起来

Hugging Face 的开源团队在 2026 年 5 月上线了 paperswithcode.co,用 AI 代理自动解析论文,把原来平台超过 9300 个基准测试的 SOTA 排行榜恢复了出来。这次复活正好赶上 CVPR,首页直接整理了会议论文和对应代码。正文没披露解析准确率和代理的具体工作流,但能看出他们想用自动化方式解决原平台长期停更的问题。

推荐理由:Hugging Face 把 Papers with Code 重新做回来了,这次用 AI 智能体自动解析论文,一口气恢复了 9300 个基准相关的排行榜。对做研究的人来说,这比手动翻论文找 SOTA 省事太多。我会先打个折:正文没披露智能体解析的准确率有多高,也没说排行榜更新频率和覆盖范围的具体边界,所以别急着当完全体用。但光是 CVPR 期间能一站式查代码和榜单,实用价值就摆在那。

量子位 · 公众号

扣子3.0实测:手机能远程遥控你电脑上的智能体干活

扣子3.0把智能体协作搬到了项目里,支持iOS、安卓、Mac、Windows和网页端。你可以把本地跑的Claude Code、Codex CLI这类命令行智能体导进去,在手机上授权后直接让它读你电脑里的PDF。正文没披露具体延迟和资源占用数据,实际体验得自己跑一遍才知道稳不稳。

推荐理由:HKR 三项都踩中了:扣子 3.0 让手机能远程指挥电脑里的 Agent,还支持导入 Claude Code 这类命令行工具,等于把 Agent 协作和跨设备控制绑在一起。不过它本质上还是一个产品更新,正文没提定价、推送范围和本地文件读取的安全边界,所以先放在 featured 这一档。

r/LocalLLaMA

微软在 Build 2026 发了两个端侧模型 Aion 1.0:一个管推理和调工具,一个管总结改写

微软在 Build 2026 大会上发了两个能在设备本地跑的模型,都叫 Aion 1.0。一个是 Aion 1.0 Plan,140 亿参数,专门做推理和调用工具,上下文窗口 3.2 万 token,会直接预装在配置够的 Windows 设备里。另一个是 Aion 1.0 Instruct,定位是总结、改写、理解意图、无障碍功能,会集成进 Edge 浏...

推荐理由:微软在 Build 2026 发了 Aion 1.0 Instruct 和 Plan 两个端侧模型,其中 Plan 是 14B 参数、32K 上下文的规划模型,会直接跟着 Windows 推给符合条件的设备。我会先打个折:文章没提许可证、跑分、具体硬件门槛,所以实际落地效果还得观望。但 Windows 内置这件事本身,分发优势和生态卡位就很明显,对做端侧 AI 和 agent 的人来说值得盯一下。

AI HOT 精选

ChatGPT 月活用户突破 10 亿,成为史上增长最快的应用

Sensor Tower 估算,ChatGPT 在 5 月全球月活用户跨过 10 亿,只用了大约三年,比 Google Maps、TikTok 和 YouTube 当年冲到这个数字的速度都快。不过,Claude 的增长势头更猛:2026 年第二季度月活 5600 万,同比涨了约 640%,而 ChatGPT 同期增速是 62%。一个值得注意的信号是,在...

推荐理由:这条消息的核心价值在于 Sensor Tower 提供了两个关键产品的用户规模估算,让行业能直观对比 OpenAI 和 Anthropic 的采用速度。我会先打个折,因为这是第三方估算,不是官方数据,但 10 亿月活和 640% 的同比增长仍然是很强的信号。正文没披露统计口径和误差范围,所以不能当精确财报看,但作为竞争格局的参考已经足够。

AI HOT 精选

xAI 发布 Grok Imagine 1.5 预览版,一张静态图就能生成 720p 视频

xAI 在 API 里放出了 grok-imagine-video-1.5-preview 模型,能把单张静态图片变成一段动态视频。你给它一张起始帧,再用自然语言描述想要的镜头运动、节奏和音效,它就会按你的指令生成一段最高 720p 的短片。官方说模型会尽量保留原图的光影和细节,让视频像是原图的延续,而不是重新画了一遍。它也支持把多段生成视频串起来,拼...

推荐理由:xAI 放出了一个能用的图像转视频 API 预览版,720p 输出加上用自然语言调镜头和音效,功能点很实在。我会先打个折,因为这只是个预览版,不是完整的基础模型发布,所以重要性停在 82 分。

AI HOT 精选

OpenAI 给 Codex 加了个 Sites 功能,能把你的想法直接变成能交互的网页

OpenAI 在 6 月 3 日上线了 Codex Sites 的预览版,目前只给 Business 和 Enterprise 用户用。你可以把想法、表格或计划扔进去,它会生成一个带托管链接的交互式网站,比如仪表盘、项目看板或规划器。生成的网站可以通过 URL 分享给团队里的指定成员,一起看、一起改。文章举了个例子:财务主管能把静态表格变成一个实时调整...

推荐理由:这是个产品更新,不是模型或底层能力发布。Codex 能直接吐网站确实实用,但先别太激动——目前只对企业版用户预览开放,正文也没说清楚生成的网站能复杂到什么程度、能不能接真实数据。我会先打个折,把它放在中等权重的产品更新档位。

AI HOT 精选

NVIDIA 发布 NemoClaw 蓝图,让工业软件能跑通自主 AI 工程师

NVIDIA 在 COMPUTEX 上放出了一个叫 NemoClaw 的开放蓝图,专门用来构建能长时间自主干活的 AI 智能体。十几家工业软件厂商已经用它来打造“自主 AI 工程师”,主要用在 CAE 仿真和 EDA 芯片设计流程里。按官方说法,以前要跑好几周的仿真和设计任务,现在能压缩到几小时内完成。不过正文没给出具体的测试基准、客户实测数据或错误率...

推荐理由:我会先打个折:这是 NVIDIA 官方博客发的,没有第三方验证,技术细节也基本没给。但它的核心信息够硬——NemoClaw 这个新平台专门瞄准 CAE 和 EDA 场景,让模型像工程师一样自主跑仿真和设计任务,而且已经拉了十多家工业软件厂商在用了。它抛出的“数周变数小时”虽然没讲清楚是怎么算出来的,但哪怕打个对折,对工业仿真这种重计算场景也是实打实的吸引力。这点先别太激动,正文没披露具体架构、模型规模和实测对比,后续得看有没有论文或客户案例放出来。

AI HOT 精选

Claude Code 现在能自己派活给多个子模型,并行干活

Claude Code 新增了动态工作流,核心是让它在运行时执行 JavaScript 文件,按需创建并协调多个子代理(subagent)。每个子代理有自己的上下文窗口,互不干扰,可以同时跑研究、安全分析和代码审查这些任务。官方举的例子是让一个子代理查漏洞、另一个审代码逻辑,主代理最后汇总结果。正文没披露子代理数量上限和额外费用怎么算,这点先别太激动。

推荐理由:HKR 三项全中:Claude Code 用运行时 JS 编排带独立上下文的子代理,这是个实打实的新功能。Anthropic 的品牌有加分,但这次是功能更新而非模型或平台级发布,所以分数落在 78–84 区间。正文没提具体性能数据和价格变化,这点先别太激动。

AI HOT 精选

Claude Code 能按任务自动生成专属工作流了,用 JS 脚本调度子智能体干活

Claude Code 加了一个动态工作流功能,你给它一个任务,它会现场写一段 JavaScript 来指挥多个子智能体分工协作。你可以指定用哪个模型、工作区隔离到什么程度,适合做研究、安全分析、代码审查这类复杂活,写好的工作流还能共享和复用。不过正文没提具体会多烧多少 token,也没说这个功能现在是不是所有人都能用,这点先别太激动。

推荐理由:HKR 三项都过,但文章只给了机制层面的细节,token 增量、推送范围和定价都没提。因为跟 Claude Code 直接相关,所以放在中量级产品更新里偏高的位置。

AI HOT 精选

Runway 把 Aleph 2.0 视频编辑放上 API,最长能改 30 秒 1080p 多镜头片段

Runway 的 Aleph 2.0 视频编辑功能现在可以通过 API 调用了,你可以把它直接嵌进自己的应用或产品里。它支持对最长 30 秒、1080p 的多镜头视频做局部修改,只动你想改的那部分,其他画面不变。正文没提价格、调用频率限制、处理延迟和地区可用性,这些实际落地要用的信息都还没给。

推荐理由:Runway 是视频生成的核心玩家,Aleph 2.0 把局部视频编辑能力开放成 API,上限拉到 30 秒和 1080p。这是个实用的产品更新,不是模型级大版本发布,重要性中等偏上。

TechCrunch · AI

微软开源新工具,用文字描述就能给 AI 模型出考卷

微软发布了一个叫 ASSERT 的开源框架,让开发者直接用自然语言写测试要求,就能自动生成一套评估 AI 行为的考题和回归测试。正文没披露它具体支持哪些模型、打分指标怎么算,也没提使用限制。

推荐理由:我会先打个折:正文没披露这个框架支持哪些模型、具体用什么指标、以及跑起来的硬件或环境要求,所以实际能省多少事还不好说。但方向本身挺对——让开发者用自然语言写测试意图,而不是手搓脚本,确实能降低回归测试的门槛。微软把它开源出来,至少说明不是内部玩具。这点先别太激动,等看到跑分和兼容性再判断值不值得集成。

Hacker News 首页

微软发布 MAI-Thinking-1,一个主打复杂推理的中等成本模型

微软一口气发了七款 MAI 系列模型,这篇公告只重点介绍了 MAI-Thinking-1。官方说它擅长解决复杂问题,在 SWE-Bench Pro(一个测代码修改能力的榜单)上拿了高分,价格定在“中等权重”档位。但正文没披露参数量、具体跑分、定价细节和上线时间,所以实际性价比和落地表现还得等更多信息。

推荐理由:HKR 三条都踩中了:微软给模型起名 Thinking,又放出 7 个 MAI 模型,正好打在它和 OpenAI 若即若离的关系上,话题性够。但正文只说了发布,没参数、没评测、没时间表,信息密度很低,所以分数卡在 76 这个 featured 门槛上,没往上拉。

AI HOT 精选

Claude Platform 推出命令行工具,终端里直接跑 API 和托管智能体

这个 CLI 工具把 Claude Platform 的所有 API 端点都搬到了终端里。你可以直接在命令行调用 Messages API、启动 Claude 托管的智能体,然后把返回结果用管道传给 shell 做后续处理。官方提到,用 Claude Code 这类编码智能体来理解这个 CLI 也没问题。正文没披露性能开销或额外费用,实际用起来会不会增...

推荐理由:Claude Platform CLI 在 HKR 三项上都站得住,是个实用的开发者工具更新。不过公告只给了能力范围,安装流程、权限控制、安全限制和定价都没提,我会先打个折——实际落地好不好用,还得看这些缺口怎么补。

FT · 科技

Anthropic 要把网络安全模型 Mythos 推到 15 个以上的国家

Anthropic 计划将 Mythos 这个专门做网络安全的模型开放给更多地区,覆盖超过 15 个国家,大约 150 家机构会用上。正文被付费墙挡住了,没披露具体是哪些国家、什么时候开始、以及模型本身的技术细节或效果数据。

推荐理由:HKR 三项都过。Mythos 扩张有具体数字和地缘安全话题性,但正文只给了接入范围,没提能力细节、具体国家名单或使用条款,所以放在 featured 低分段。

TechCrunch · AI

微软给开发者发了份说明书,让 AI 代理的行为能按规矩来

微软发布了一份 AI 代理的行为规范说明书,让开发、合规和安全团队能把想让代理遵守的规则,写进可移植的策略文件里。正文没提版本号、开源协议、支持哪些开发框架,也没说什么时候正式上线。

推荐理由:我会先打个折:正文没披露版本号、开源协议和具体支持的框架,所以没法判断落地有多顺滑。但“可移植策略文件”这个机制本身是实在的,它让开发、合规、安全三拨人能用同一份文件定规矩,不用各说各话。对正在搭 Agent 的团队来说,规则能不能跨栈迁移是个真需求,这点先别太激动,但值得放进 featured 里提醒大家关注。

AI HOT 精选

微软推出 Scout 个人助手,基于 OpenClaw,能常驻在 Outlook 和 Teams 里干活

微软发了 Microsoft Scout,一个能一直挂在 Outlook、OneDrive、Teams 里的 AI 助手。企业可以把它分给员工,让它帮忙管日历、处理报销、起草邮件。微软副总裁 Omar Shahine 说这是他们第一次给客户一个真正的个人助手,功能比应用内嵌的 Copilot 更宽。不过正文没提 OpenClaw 具体是什么、怎么跟现有...

推荐理由:这篇就是微软 workplace agent 的产品更新,给了集成范围和任务类型,但没给定价、上线时间,也没技术细节。信息量够上 featured 低段,但别指望从这篇看出落地节奏。