跳到正文

#产品更新

今日 25 条

5月22日星期五

Hacker News 首页

Superset:一个能同时派多个 AI 编程助手干活的开源编辑器

Superset 把自己定位成“AI 代理时代的代码编辑器”,核心卖点是能在一台机器上并行跑 Claude Code、Codex、OpenCode 等多个编程助手,通过 git worktree 让它们互不干扰地改代码。团队还放出了 Remote Workspaces 的测试版,可以在远程机器上跑这些助手,再从桌面应用里统一管理。项目在 GitHub ...

推荐理由:HKR 三项都踩中了,但这是 YC 新项目的首发帖,正文没给用量、定价和性能对比。git-worktree 并行 agent 这个工作流设计够上 featured,但离必写还差实际验证数据。

Mistral AI

Mistral 在 Studio 发布 Connectors,支持内置与自定义 MCP

Mistral 在 Studio 发布 Connectors,所有内置连接器和自定义 MCP 现可通过 API/SDK 用于全部模型与智能体调用。新功能包括直接工具调用、human-in-the-loop 审批流程,以及对连接器的创建、修改、列出和删除等编程访问。

推荐理由:原文给出 Connectors 的 API 用法与代码示例,读者可据此判断企业级 MCP 集成如何落地。

AI HOT 精选

Karpathy 用 65 行规则文件把 AI 编程准确率从 65% 拉到 94%

Karpathy 在 GitHub 上发了一个叫 CLAUDE.md 的规则文件,65 行、4 条规则,让 AI 编程准确率从 65% 跳到 94%。核心思路是逼开发者先想清楚再动手:深度思考、代码越短越好、只改该改的地方、每一步都盯着目标走。文件已经拿了超 22 万星标,但正文没披露 94% 这个数字是在什么任务、什么模型上测出来的,也没说对比基线是...

推荐理由:这篇我会先打个折,因为正文只给了总结性的数字,没披露具体是哪 4 条规则、在什么任务集上测的、评测方法是什么。但 Karpathy 这个名字加上 94% 这个数字,对用 Claude Code 干活的人来说,诱惑力足够大。22 万星标也说明社区在追这个方向。所以虽然信息有缺口,还是值得推给读者看一眼,只是别把 94% 当成普适结论。

AI HOT 精选

阿里千问 App、PC 及网页端上线 Qwen3.7-Max,免费可用

千问 App 更新到 6.9.7 版就能在对话框里切到 Qwen3.7-Max,PC 和网页端也一样,目前免费。官方说这个模型主打“让模型进业务流程干活”,能写代码、自动跑办公流程,还能扛住长任务——他们自己测了一次 35 小时、调用工具超过 1000 次的内核优化实验,全程没断思路。不过这些数据来自官方测试,实际体验会不会打折还得自己试。另外,API...

推荐理由:阿里把 Qwen3.7-Max 铺到千问全线产品,门槛降到免费,还特意强调 35 小时连续工具调用没崩,摆明了在打 agent 可靠性和零成本体验这两张牌。我会先打个折:正文没给基准测试、上下文窗口和 API 定价,所以实际能力上限和商用成本还看不清。但就凭多端同步上线和这个压测结果,对正在选模型做工具链集成的人来说,是个值得立刻上手试的信号。

MIT Technology Review · AI

Google I/O 暴露了 AI 做科研的两条路:专用工具还在用,但资源正流向通用智能体

Google I/O 上,DeepMind 的 Hassabis 一边用“我们正站在奇点的山脚下”这种大词,一边展示的是 WeatherNext 提前预警飓风救了人命。这正好点出了 AI 做科研的两条路线:一条是像 WeatherNext、AlphaFold 这种专为解决某个科学问题训练的专用工具;另一条是让通用大模型像智能体一样自己搞研究。现在资源明...

推荐理由:我会先打个折:这篇是 MIT Technology Review 的评论,不是一手技术报告,所以细节有限。但它的判断站得住——Google 把科学 AI 的牌子从 AlphaFold 那套单独炫技,换成 Gemini for Science 这个统一入口,还塞进了 AI Co-Scientist 和 AlphaEvolve 两个组件,并且开放申请。对做 AI 应用的人来说,这比发一篇论文实在,因为能摸到产品了。不过别太激动,正文没披露这套东西的算力成本、实际科研产出对比,也没说普通团队用不用得起,所以目前更像一个方向牌,不是落地手册。

新智元 · 公众号

微软投了 OpenAI 130 亿,自家工程师用 Claude Code 把账本烧穿了

微软计划在 6 月底前停掉体验与设备团队的 Claude Code 订阅,把近 10 万工程师迁到 GitHub Copilot CLI。文章把原因归结为外部按 token 计费的成本太高,但正文因为需要验证码没加载出来,具体烧了多少钱、内部怎么讨论的都没看到。

推荐理由:我会先打个折:这不是模型发布或官方重大产品更新,更像一次内部成本管控动作。但 HKR 三项都站得住——微软投 OpenAI 又禁 Claude Code 的对比很抓人,时间、人数、计费原因都给了,而且直接踩中编程助手在企业里怎么省钱的痛点。正文没披露具体账单金额,所以别把省钱效果说死。整体适合放在 featured 位置,81 分合理。

新智元 · 公众号

Anthropic 更新了 Agent 架构,但正文被验证页挡住了,没法确认具体改了什么

这篇文章的链接点进去只显示“环境异常,需要验证”,正文内容完全看不到。从已有的英文摘要看,阿里云的 JVS Crew 把 Agent、环境和会话拆成了三层,加了沙盒、快照恢复、权限控制和按量计费;Anthropic 在 5 月 19 号给 Claude 托管 Agent 加了自托管沙盒。文章还提到几个国内客户案例,说部署周期两周,效率提升 5 到 10...

推荐理由:文章把阿里云 JVS Crew 和 Anthropic 的沙箱更新放在一起比,讲的是企业级 agent 基础设施怎么落地。有具体架构细节,也有安全与计费的讨论,对正在选型或关注 agent 生产化的从业者有用。不过 Anthropic 那部分信息偏薄,正文没展开 self-hosted sandboxes 的限制和实际表现,这点先别太激动。整体属于值得一看的产品对比,不是必写的模型发布。

AI HOT 精选

OpenAI Codex 的 /goal 模式转正了,现在可以给 AI 派跨小时甚至跨天的长任务

OpenAI 把 Codex 里的 /goal 模式从实验功能升级成了稳定版。你可以在 Codex 应用、IDE 插件或命令行里用,设定好里程碑后,AI 会自己跑任务,持续几小时甚至几天。中间能随时查看进度、改方向或暂停。用之前要升级应用并打开这个功能(命令行或手动改配置文件都行),开启后在输入框就能管理任务,侧边对话可以看进度,不会打断主任务。正文没...

推荐理由:我会先打个折:文章只说了功能转正和多端支持,但没披露任务失败怎么恢复、资源消耗上限、以及哪些套餐能用。对想试的人,知道它能跑长任务就够了;对想上线用的人,信息缺口还很大。所以放在 featured 低段,等后续补上安全和成本细节再往上调。

Hacker News 首页

sddw:给 Claude Code 加一套分步写规格、清上下文的开发流程

作者开源了一个 Claude Code 插件,把开发任务拆成需求、代码分析、设计三份规格文档,再把实现切成多个子任务逐个做。每完成一个步骤就清一次上下文,目的是让模型每次只盯一小块,减少跑偏,也省 token 钱。规格文件落地到磁盘,方便断点续传,也能在早期发现模型理解错的地方。正文没给出具体省了多少成本或性能提升的量化数据,这点先别太激动。

推荐理由:我会先打个折:正文没给性能对比、没披露实际省了多少 token、也没说在复杂项目上的表现,所以不能给太高。但三层规格加每步清上下文这个组合拳,确实戳中了用 Claude Code 写代码时上下文越跑越偏、账单越来越贵的真实问题。对正在折腾 coding agent 的人来说,这个思路值得看一眼,只是别指望拿来就能用,还得自己踩坑验证。

Computing Life · Share · 鸭哥调研

DS4 引擎让 DeepSeek V4 Flash 在 Mac 上跑起来了,还解决了 agent 对话的“失忆”问题

DeepSeek V4 Flash 是个 284B 总参数、13B 激活的 MoE 模型,性能接近前沿水平,但主流推理引擎在 Mac 上都跑不了。antirez 专门为它写了 DS4 引擎,纯 C、Metal 优先,一个编译命令就能用。它最特别的地方是解决了 agent 工作流里的上下文断裂:模型生成工具调用时,DS4 会记住原话,下次 agent 返...

推荐理由:标题和摘要给的期待是“在 Mac 上本地跑 DeepSeek V4 Flash 的实操方案”,但正文只列了 DS4 引擎的三项机制名称,没给出模型大小、实际性能、Mac 兼容性要求,也没有可复现的测试结果。我会先打个折:对想动手试的开发者来说,知道有这些机制存在已经算有用信息,但离“能照着做”还差关键数据。H、K、R 三项都踩中了,信息缺口也明显,放在 featured 层级刚好——够吸引人点进去看,但读完会发现缺胳膊少腿。

Computing Life · Share · 鸭哥调研

智谱 GLM-5.1 API 跑到每秒 400 个 token,靠的不是优化,是换了一套执行逻辑

智谱在 5 月 22 日放出了 GLM-5.1 高速版 API,输出速度标称 400 tokens/s,是人类阅读速度的 80 倍以上。这个速度不是靠传统编译优化“调”出来的,而是底层的 TileRT 推理引擎把 GPU 的工作模式从“批处理车间”改成了“连续流水线”——取消计算步骤之间的等待和隔离,让数据持续流动,GPU 不再频繁启停。模型本身也做了...

推荐理由:400 tokens/s 是个好钩子,但正文没交代测试条件、并发数、输入长度和计费规则,所以速度先打个折看。TileRT 的说法有信息量,不过没展开具体怎么重构执行模型,技术细节偏薄。整体对从业者有提醒价值,但缺少独立验证,所以分数停在 78 不动。

AI HOT 精选

Claude Code v2.1.147 新增 Workflow 工具,/simplify 改名 /code-review 并支持生成 PR 行内评论

Claude Code 发了 v2.1.147。这次加了一个叫 Workflow 的新工具,默认是关着的,用来做确定性的多智能体编排——你可以把它理解成让多个 AI 助手按固定流程协作干活,而不是自由发挥。另一个变化是把原来的 /simplify 命令改成了 /code-review,功能也升级了:现在会报告代码正确性,还能直接在 GitHub PR ...

推荐理由:这是 Claude Code 的一个小版本更新,但 Workflow 工具的加入让产品从单智能体往多智能体协作迈了一步。工具默认关闭,说明还在试探阶段,正文没披露性能数据、定价或使用范围,所以先别太激动。把 /simplify 改名为 /code-review 也更直白,知道是拿来审代码的。整体看,对关注编码智能体稳定性的从业者是个值得留意的信号。

Latent Space

给 AI 智能体配台电脑:Daytona 创始人聊 60 毫秒启动、85 万次日均运行的沙箱生意

Daytona 做的不是简单的代码执行盒,而是给 AI 智能体用的“可组合电脑”。他们的沙箱最快 60 毫秒就能启动一个,5 万个沙箱大约 75 秒就能跑起来,最大的客户一天要跑将近 85 万个沙箱。创始人 Ivan Burazin 从十多年前就在喊“干掉本地开发环境”,现在 AI 智能体成了他理想的落地场景:智能体不在乎你的笔记本配置,它只需要一个能...

推荐理由:我会先打个折:这是创业公司的基础设施故事,不是大模型或平台级发布。但 HKR 三项都站得住——标题有钩子,性能数字实在,痛点也踩得准。正文没披露客户名字和具体成本,这点先别太激动。

AI HOT 精选

ChatGPT 开始能在 PowerPoint 里直接做 PPT 了,目前还在测试

ChatGPT 正在测试一项新功能:你可以直接在 PowerPoint 里让它帮你建、改、理解、优化幻灯片,做出来的页面还能继续手动编辑。官方只发了这条推文,没提收费方式、推送范围,也没说什么时候正式上线。如果是真的,以后做 PPT 能省不少事,但正文没披露具体支持哪些功能、会不会出错,这点先别太激动。

推荐理由:OpenAI 让 ChatGPT 在 PowerPoint 里直接建和改可编辑的幻灯片,不是只吐文字或图片。正文没提价格、开放范围和企业管控细节,所以先放 featured 而不是 P1。

AI HOT 精选

Datasette Agent 发布:给数据库配了个能聊能画图的 AI 助手

Simon Willison 把做了三年的 LLM 库和 Datasette 数据库工具终于接上了,发布了 Datasette Agent。你可以直接用对话的方式问数据库里的问题,比如“我最近一次看到鹈鹕是什么时候”,它会自己写 SQL 去查。配合插件还能自动生成图表、用 ChatGPT 画图,或者在沙箱里跑代码。线上演示跑的是 Gemini 3.1 ...

推荐理由:Datasette 给自家工具加了个能聊天的 agent,支持插件画图,还能选 Gemini 3.1 Flash-Lite 或 LM Studio 本地模型。对搞数据的人来说,这比大厂发新模型更实在——它解决的是“我能不能在自己机器上安全地用 AI 查数据”的问题。不过正文没披露本地模型的具体效果和延迟,这点先别太激动。整体看,实用性强但受众偏窄,放在 featured 里合适。

彭博科技

SpaceX 要在奥斯汀附近建一座年产 10 吉瓦的太阳能电池工厂,给马斯克的太空 AI 数据中心供电

SpaceX 计划在得州奥斯汀附近建一个 10 吉瓦的太阳能电池制造厂。10 吉瓦这个数字很大,相当于好几个大型核电站的发电能力。工厂产出的电池主要不是卖给电网,而是直接给马斯克提出的“太空 AI 数据中心”供能——也就是把算力搬到轨道上,靠太阳能驱动。文章没披露工厂具体投资额、建设时间表,也没说太空数据中心本身的技术方案到底走到哪一步了。这点先别太激...

推荐理由:HKR 三项都过了。太空 AI 数据中心这个角度够新鲜,10GW 奥斯汀工厂是实打实的新信息,供电问题又是当下 AI 基建的核心焦虑。分数留在 72–77 区间,因为正文没披露成本、工期和具体建设方案,我会先打个折,这点先别太激动。

AI HOT 精选

Codex 现在能远程操控锁屏的 Mac,手机就能指挥它干活

OpenAI 开发者账号发帖说,Codex 可以在 Mac 锁屏、屏幕关闭的情况下,通过手机安全地使用 Mac 上的应用。帖子没提权限边界、怎么收费、什么时候上线,我会先打个折——正文只给了一个文档链接,具体怎么实现“安全”也没展开。

推荐理由:HKR 三项全中:OpenAI Devs 给出了 Codex 操控 Mac 的具体条件,但正文没披露权限边界、价格和发布时间,所以重要性停在 82 分,没上 85+。我会先打个折——这个功能听起来很省事,但没讲清楚锁屏下到底能碰哪些文件、会不会被滥用,这点先别太激动。

AI HOT 精选

Runway 上线 Aleph 2.0 和 Edit Studio,把生成、剪辑、后期塞进一个平台

Runway 把新模型 Aleph 2.0 直接做成了一个叫 Edit Studio 的剪辑工具,主打用自然语言改视频,改之前还能先预览效果。从页面看,它把视频生成、多镜头合成、场景搭建、画质增强、动作捕捉和物体移除这些功能都打包在一起了,想覆盖从创意到出片的完整流程。不过正文没披露 Aleph 2.0 的具体技术参数、定价和推送范围,实际效果和成本还...

推荐理由:Runway 是 AI 视频领域的主要玩家,这次更新属于中等体量的产品动作。我会先打个折:标题听起来挺大,但正文没给价格、没给参数、没给上线范围,所以实际能判断的东西有限。HKR 三项都能过——一句话能讲清卖点,有具体新名字,也踩中了行业竞争的脉络——但信息缺口让它停在 featured 这档,再往上就缺硬证据了。

AI HOT 精选

Claude 企业版接入 28 款安全合规工具,IT 团队能像管其他应用一样管 AI 了

Anthropic 给 Claude 企业版和平台新增了 28 个安全合规集成,背后靠的是 Claude Compliance API。这个 API 能把 Claude 里的对话内容和操作记录,直接送进企业已经在用的数据防泄漏(DLP)、安全信息与事件管理(SIEM)这类监控系统里。简单说,就是让安全团队用现有工具就能看到员工跟 Claude 聊了什么...

推荐理由:Anthropic 给 Claude 企业版和平台加了 28 个安全合规集成,通过 Compliance API 把对话内容和活动事件喂给数据防泄露(DLP)和安全信息管理(SIEM)系统。对想用 Claude 又怕合规翻车的团队来说,这波操作把审计和监控的坑填了不少。正文没提延迟和成本影响,但集成数量本身说明他们在补企业落地的课。

AI HOT 精选

谷歌发布 Kotlin 版和 Android 版 Agent 开发套件 0.1.0,让 AI 能在手机本地跑任务

谷歌把 Agent 开发套件(ADK)带到了 Kotlin 和 Android 上,版本号 0.1.0。Kotlin 版负责后端流程,Android 版则专门为手机端做了优化,能直接调用 Gemini Nano 这类本地模型干活。这套东西的核心是混合调度:你可以让云端大模型当总指挥,把涉及隐私的具体任务(比如查本地文件里的酒店预订)派给手机上的子 Ag...

推荐理由:Google 这次发了两个 ADK:Kotlin 版给后端搭 Agent 工作流,Android 版让 Agent 跑在手机上。版本号 0.1.0 说明还在早期,功能边界和稳定性都别抱太高期待。正文只交代了平台和版本,没给性能数据、实际案例或开发者规模,所以我会先打个折——方向对,但落地效果还得看后续。

Hacker News 首页

Runtime 给团队里每个人配一个沙盒编程助手,支持 Claude Code、Cursor 等主流工具

Runtime 做了一套开源的沙盒基础设施,让公司里不只有工程师能用编程助手,产品、设计、市场、客服也能在安全隔离的环境里让 AI 帮忙改代码、查数据、发 PR。它兼容 Claude Code、Codex、Cursor、Copilot、Gemini CLI 和 Devin 这些主流编程助手,可以接入公司自己的工具链(比如 Datadog、Salesfo...

推荐理由:我会先打个折:正文没披露实际客户或用量数据,所以别当成熟产品看。但它的切入点很准——企业不敢让编程代理直接跑在内部环境,Runtime 用沙盒把代理隔离开,还开源了基础设施,等于给团队一个低风险试水的入口。支持六种代理、不加价 token 的定价,也让成本更可预测。对正在评估编程代理的团队,这是个值得跟进的信号。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

The Verge · AI

Spotify 要给付费用户上线 AI 混音和翻唱功能,环球音乐已签授权

Spotify 和环球音乐刚谈成一笔授权,Premium 用户能付费让 AI 把平台上的歌生成混音版或翻唱版。艺人可以选择不参加,参加的能从这些 AI 版本里分到版税。去年 10 月 Spotify 就说过要和几大唱片公司搞“负责任的 AI 产品”,这次算是第一个落地的。正文没披露具体定价、上线时间,也没说 AI 模型是谁家的、生成质量到什么程度。

推荐理由:Spotify 和环球音乐达成授权,让付费用户自己生成 AI 混音和翻唱,不是发模型或开发工具,而是直接做成消费功能。我会先打个折:正文没披露生成质量、延迟和实际定价,也没说版税怎么算、退出机制怎么落地。但光是“正版授权+付费使用+艺人可退出”这套组合,就已经把 AI 音乐从技术 demo 往产品化推了一步,所以放在 featured 档。

FT · 科技

Spotify 和环球音乐签了授权,要在 App 里给重度乐迷推 AI 生成的付费音乐

Spotify 跟环球音乐集团谈成了一笔授权,打算在 Spotify 应用内加一个付费的 AI 音乐生成功能,主要瞄准那些花钱不手软的重度乐迷。目前正文被付费墙挡住,看不到具体定价、上线时间、支持哪些国家,也没提用的是什么模型。

推荐理由:我会先打个折:定价、上线时间和钱怎么分,正文都没说,所以这条还到不了必写的程度。但 Spotify 和环球音乐把 AI 音乐从技术演示变成应用内付费产品,方向很明确——瞄准愿意多花钱的铁粉,用 AI 工具让他们自己生成内容。这比单纯放个 AI 歌单更进一步,等于把生成能力直接卖给用户。版权和收入分配是绕不开的雷区,正文没披露分成细节,这点先别太激动。

MIT Technology Review · AI

Anthropic 在伦敦办了一场开发者大会,近半数人举手说上周刚发过完全由 Claude 写的代码,而且很多人没看就直接上线了

Anthropic 在伦敦的 Code with Claude 大会上展示了一个趋势:开发者越来越愿意把写代码的活直接交给 AI。工程师 Jeremy Hadfield 在现场问谁上周发过完全由 Claude 写的 pull request(提交审核的代码改动),近一半人举手;再问谁没读代码就直接发了,大部分手还举着。Anthropic 说公司内部大部...

推荐理由:这篇 MIT Tech Review 的现场报道不是产品发布稿,但抓到了一个很实的信号:开发者已经在把 Claude 写的代码直接往仓库里合,而且不少人连看都不看。我会先打个折,这个数字来自活动现场举手统计,样本量和代表性都有限,不能直接推成行业常态。但“近一半”这个比例还是够高,说明在重度用户里,对 AI 代码的信任已经跨过了一道心理门槛。文章没给 PR 的复杂度或后续回滚率,这点信息缺口让判断只能停在“行为在发生”而不是“行为没问题”。整体适合放进 featured,因为它比功能更新更能让人停下来想一下自己的工作流。

r/LocalLLaMA

LLM 硬件规划器:按你的用途、模型或预算挑一套跑本地模型的机器,或者给现有机子选模型

totosse17 做了一个叫 LLMRequirements 的硬件规划工具,整理了 60 多套装机方案、50 多个模型,还附了 130 多个有来源标注的每秒 token 生成速度、150 多个评测视频。它会标每套配置的待机功耗和满载功耗,价格覆盖多个地区,数据放在 GitHub 上公开更新。不过 Reddit 原帖正文被屏蔽了,具体界面长什么样、交...

推荐理由:这是一个 Reddit 社区作者做的本地 LLM 硬件规划器,不是大厂产品发布,但信息密度很高。我会先打个折:它更像一个持续更新的公开数据集和参考表,不是一键自动优化的工具。正文没披露数据更新频率的具体机制,但 130 多个 tok/s 来源和 150 多个评测视频让它比一般论坛帖子可信不少。对想自己攒机器跑模型的人来说,功耗和地区价格都列出来,省得自己到处翻,这点挺实在。

The Verge · AI

我用谷歌 AI Studio 一个下午“氛围编程”搞出了三个安卓 App,第一个只靠 148 个字的提示词

The Verge 的编辑 Sean Hollister 用谷歌 AI Studio 试了一把“氛围编程”,一个下午生成了三个安卓 App。其中一个 App 他只输入了 148 个字的提示词,大概 10 分钟后就在自己的安卓手机上装好跑起来了。前提是他提前把手机开了 USB 调试模式并连上电脑,剩下的活 AI Studio 全包了。他感叹这速度让他差点...

推荐理由:这不是 Google 官方大发布,而是一篇带实测细节的第一人称体验文,有梗有数字,适合放进精选。

Hacker News 首页

Google 正式宣布 AI 模式搜索结果里会插广告

Google 在 2026 年 5 月的营销大会上确认,AI 模式(AI Mode)的搜索结果里要开始放广告了。他们用 Gemini 模型做了两种新广告形式:一种是对话式发现广告,另一种是突出显示答案的广告,广告里还会带一个独立的 AI 解释器,帮你判断产品靠不靠谱。同时,他们也在扩大 Direct Offers 的试点,让用户能直接在搜索结果里结账或...

推荐理由:这条消息本身够直接:Google 亲口说 AI 模式的搜索结果里要加广告了。对从业者的冲击在于,之前大家还在猜 AI 搜索会不会保持无广告的纯净体验,现在靴子落地了。我会先打个折——正文只给了 78 分和 66 条评论,广告格式、投放机制、上线时间全都没写,所以实际影响有多大还看不清。但光是“确认会加广告”这一点,就足够让做搜索优化和广告投放的人紧张起来,因为流量分配和预算逻辑可能又要重算一遍。这点先别太激动,等具体规则出来再判断力度,但信号本身值得放进精选里。

新智元 · 公众号

Anthropic 买下 SDK 工具商 Stainless,OpenAI 等客户得自己维护代码库了

Anthropic 把 Stainless 给收购了。Stainless 是一家专门帮公司自动生成和维护 API 的 SDK(软件开发工具包)的公司,OpenAI、Meta、Cloudflare 之前都是它的客户。收购之后,Stainless 会关掉它的托管产品,也不再给老客户提供后续支持。不过,之前已经生成的 SDK 代码所有权还归客户自己,只是后续...

推荐理由:我会先打个折:这不是模型发布或核心能力更新,所以分数不会顶满。但 Anthropic 这手挺狠,Stainless 是给 API 自动生成 SDK 的,全球据说四分之一开发者都在用,客户包括 OpenAI 和 Meta。收购后 Anthropic 直接要把托管产品关停,等于断了竞争对手一条现成的开发者工具链。正文没披露收购金额和具体关停时间表,但光是“断供 OpenAI”这个动作,就够让依赖这套工具的团队紧张一阵了。

机器之心 · 公众号

智谱在千卡集群部署 ZCube,同样 GPU 推理吞吐提升超 15%

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里,规模是千卡级别。它替换了原来的 ROFT 组网方式,但没动 GPU、软件栈和业务代码。效果上,吞吐量提升了超过 15%,首 token 延迟的 P99 下降了 40.6%,交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的,也没给更细的测试条件,所以这个 1...

推荐理由:智谱在 GLM-5.1 千卡推理集群上部署 ZCube,不增 GPU、不改代码就把吞吐提了 15%,首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动,不是模型能力升级,所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用,但不会像新模型发布那样震动整个行业。

AI HOT 精选

FSD 官宣进入中国大陆,但没公布城市、车型和价格

特斯拉发了一条很短的官宣,说 FSD 正式进入中国大陆市场。正文没披露哪些城市能用、支持什么车型、怎么收费,也没提监管审批情况。目前只有一句话,我会先打个折,等具体落地细节出来再看。

推荐理由:我会先打个折:这条消息本身很短,就是一句“官宣进入大陆”,所以重要性更多来自 FSD 进中国这件事本身,而不是正文给了多少料。H 和 R 都成立——市场等这个落地等了很久,而且它确实会搅动自动驾驶圈的监管和竞争话题。K 不成立,因为正文没披露任何落地范围、定价或审批细节,没法当干货用。

AI HOT 精选

Google DeepMind 给 Antigravity 配了一套科学工具包,把 UniProt、AlphaFold 等 30 多个生命科学数据库接进 ...

Google DeepMind 在自家 Antigravity 平台上推出了 Science Skills,相当于给 AI 装了一个生命科学专用工具箱。它直接接入了 UniProt、AlphaFold 等 30 多个主流数据库,让模型在回答问题时能实时调取蛋白质结构、基因功能这些专业信息,而不是靠训练时记下的旧知识硬猜。正文没披露具体延迟和准确率提升数...

推荐理由:Google DeepMind 这次没发新模型,而是给自家 Antigravity 装了个科学技能包,把 UniProt、AlphaFold 这类数据库直接塞进工作流。我会先打个折:这不是底层突破,更像给研究员配了个能查资料、跑数据的助手。30 多个来源听着不少,但正文没披露实际任务成功率或延迟,也没说和现有工具比快多少、省多少。对做生命科学的人有用,但对不碰这行的从业者,暂时看不出必须关注的理由。

AI HOT 精选

腾讯发布操作系统层级的 AI 助手“马维斯”,Windows、Mac、安卓同步上线

腾讯公关总监张军宣布 AI 助手“马维斯”正式上线,覆盖 Windows、Mac 和安卓。它不是一个普通的聊天窗口,而是直接长在系统层,能理解文件结构、归类解析文档、识别处理图片,甚至帮你修电脑。官方说市面上 Agent 能做的事它基本都能做,还能调度不同模型、在电脑上操控手机应用。比较实在的一点是,它预装了不少本地模型,通过路由机制把轻量任务分给本地...

推荐理由:腾讯把 AI 助手直接做进操作系统层,Windows、Mac、安卓一起发,能读文档、识图、做系统维护,还能跨设备操控,部分功能离线可用。我会先打个折:正文没披露背后的模型、定价和权限设计细节,所以目前只能看到产品形态,看不到技术底牌。这点先别太激动,但三端同步和系统级操控确实把桌面 agent 的竞争往前推了一步,对做 agent 和端侧部署的团队来说是个值得盯的样本。

Latent Space

Railway:为 AI 代理而生的云,35 人撑起 300 万用户

Railway 创始人 Jake Cooper 聊了他们怎么从 18 个月攒 100 个用户,做到现在每周新增 10 万注册。团队只有 35 人,服务 300 万用户,融了 1.24 亿美元。他们把大部分工作负载搬到了自建裸金属数据中心,回本周期只要 3 个月,对比租用云服务能省下不少钱。Jake 认为未来的软件是给 AI 代理用的,不是给人用的,所以...

推荐理由:这篇访谈不是讲模型本身,而是讲基础设施怎么为 agent 工作负载重新设计。Railway 用一个小团队撑起 300 万用户,还做了裸金属迁移,对做 agent 部署的开发者来说是个很实在的参考。信息密度和话题性都够,但毕竟不是核心模型发布或重大产品更新,给 74 分放在 featured 里比较合适。

AI HOT 精选

Google 把设计搭子 Stitch 升级了,现在能读你的代码库直接生成界面

Stitch 这次更新主要干了四件事。一是实时流式出设计稿,你边改它边生成,不用干等。二是能直接导入现有代码库或 Design.md 文件,拿你项目里真实在用的组件来做设计,品牌风格不容易跑偏。三是加了动态界面生成,四是做完的设计可以导出成一个可分享的线上链接,省掉从原型到上线中间一堆部署步骤。工具现在已经全球开放,正文没提收费模式。

推荐理由:我会先打个折:正文没披露模型细节、定价和实际输出质量,所以别急着当生产工具。但 Stitch 这次更新把实时流式构建和代码库导入加进来,等于让 AI 直接读你的代码和设计文档来生成页面,不再是画个样子就完事。对天天在 Figma 和代码编辑器之间切换的团队,这个流程缩短挺实在。全球开放也让更多人能上手试,不过没看到成本或准确率数据,这点先别太激动。

彭博科技

英伟达上季度每股赚 1.87 美元,超预期,下季度营收指引 910 亿

英伟达刚发了 2026 财年第一季度的财报,每股收益 1.87 美元,比华尔街预期的 1.77 美元高出一截。公司对截至 7 月的当季营收指引是 910 亿美元,也明显高于市场预估的 874 亿左右。这条视频本身是彭博的报道片段,正文没披露各业务线的具体表现和毛利率细节,所以没法判断增长是数据中心业务继续拉动的,还是有别的板块在补位。

推荐理由:Nvidia 财报是观察 AI 基础设施热度的关键节点,910 亿的指引给 HKR 三项都提供了实打实的信号。这不是模型或功能发布,所以放在 featured 档位没问题,信息质量够硬。

AI HOT 精选

英伟达一季度净利润 583 亿美元,同比涨了 211%,数据中心收入占了大头

英伟达 2027 财年第一财季(截止到 2026 年 4 月 26 日)总收入 816.15 亿美元,净利润 583.21 亿美元,同比直接翻了两倍多。增长主要靠数据中心业务,单这一块就进账 752 亿美元,同比涨了 92%。毛利率也拉到了 75% 左右,比去年同期高了 14 个百分点。公司预计下个季度收入能到 910 亿美元,上下浮动 2%。另外,董...

推荐理由:英伟达这份财报就是AI基础设施景气度的温度计。数据中心752亿美元的收入说明大厂还在疯狂囤卡,211%的利润增速比很多AI公司的营收涨得还快。我会先打个折:这是财务数据,不是新模型或新功能发布,所以重要性停在82分。但数字本身已经足够让关注算力成本和供应链的人必须看一眼。

AI HOT 精选

OpenAI 官宣 GPT-5 要来了,但除了这句话什么都没说

ChatGPT 官方账号发了条推,就一句话“GPT-5 即将发布”,配了个船的表情。没给发布日期、参数规模、上下文窗口长度、定价,也没提 API 什么时候开放。我会先打个折——这种预告大概率是提前占坑,离真正能用还有段时间。

推荐理由:这条消息我会先打个折。标题确实抓人,但正文等于什么都没说,没日期、没参数、没价格、没 API 细节,连“即将”是多快都判断不了。如果是真的,对做模型选型和成本估算的人影响不小,但现在只能当个预告看,别太激动。

AI HOT 精选

Perplexity 上线查询感知压缩,上下文 token 最多砍掉 70% 但回答质量反而更好

Perplexity 把一项叫“查询感知压缩”的技术用到了线上。它能在搜索时把喂给模型的上下文 token 最多减少 70%,同时回答质量还提升了。核心逻辑是“更好的上下文优于更多的上下文”,也就是先理解你问什么,再挑最相关的信息塞进窗口,而不是一股脑全丢进去。正文没披露具体测试基准和压缩方法细节,所以实际效果我会先打个折,但能省下这么多 token ...

推荐理由:我会先打个折:正文只给了一条 X 帖子,没放基准测试和可复现的设置,所以别太激动。但这条信息本身够硬——Perplexity 在生产环境用查询感知压缩,最多砍掉 70% 上下文令牌,同时回答质量还变好了。对搞外挂资料库和搜索优化的从业者来说,这直接关系到省钱和降延迟,值得看一眼。

AI HOT 精选

ChatGPT 手机版接入 Codex,手机上问一半,回到电脑能接着聊

OpenAI Devs 发帖说 ChatGPT 移动端现在支持 Codex,你可以在手机 App 里提问,之后在桌面端继续同一个对话。帖子没提支持哪些平台、需要哪个 App 版本,也没说是不是逐步推送。

推荐理由:OpenAI Devs 是官方渠道,消息可信,HKR 三项都踩中了。但正文只确认了移动端能用 Codex 和跨设备接续对话,具体支持哪些平台、版本号、推送范围全都没提,所以信息量刚好卡在 featured 门槛上,先别当全量上线看。