跳到正文

#MCP/工具调用

今日 5 条

5月30日星期六

TechCrunch · AI

我让谷歌的 24 小时 AI 助手 Gemini Spark 干了一天活,它确实挺有用

TechCrunch 的编辑实测了谷歌新推出的 Gemini Spark,把它当成一个全天候 AI 助手来用,主要干了整理邮件摘要和规划本地活动这两件事。体验下来觉得确实能帮上忙,但文章没搞懂谷歌为什么要把这个功能单独做成一个产品,而不是直接塞进现有的 Gemini 里。正文没披露这东西什么时候正式上线、要不要另外收费。

推荐理由:我会先打个折:正文没披露价格和发布时间,所以不能当产品发布看。但亮点在于,这是一篇上手实测,不是通稿。编辑用“actually pretty useful”收尾,说明 Gemini Spark 在收件箱摘要和本地活动规划这两个场景里跑通了,没翻车。对做 agent 的人来说,这种“替你干活”的体感比跑分重要。信息缺口明显,但反转叙事和具体场景撑住了 featured 的分数。

AI HOT 精选

Google 把两个新图像模型 Nano Banana Pro 和 Nano Banana 2 挂上了 Gemini API

Google AI Developers 发推说 Nano Banana Pro(对应 gemini-3-pro-image)和 Nano Banana 2(对应 gemini-3.1-flash-image)已经正式发布,可以直接通过 Gemini API 调用。推文里贴了一些社区示例展示效果,但正文没披露定价、跑分、单次生成耗时或调用频率上限,想上...

推荐理由:我会先打个折:这就是个产品更新,不是技术突破。Google 把两个图像模型挂上 Gemini API 标成生产可用,对想用的人是个信号,但正文没披露价格、没给跑分、也没说调用限制,所以没法判断性价比。名字叫 Nano Banana,听着像玩梗,但背后就是 gemini-3-pro-image 和 gemini-3.1-flash-image,别被名字带偏。

新智元 · 公众号

Anthropic 内部流出一份 Claude 流畅度评分表,最高 11 分,优秀人类能拿 7.5

这份评分表把用户跟 Claude 的对话拆成 11 个可观察的行为指标来打分,满分 11 分。背后的研究用了 9830 组匿名多轮对话,发现高质量对话里 85.7% 都出现了“反复修改追问”这个动作。正文没披露具体评分细则和实验设计细节,目前只能看到评分框架,所以这个 7.5 分到底怎么算出来的还不清楚,先别太激动。

推荐理由:这篇的切入点是把 AI 和人的关系倒过来,用评分卡的形式讲 Claude 怎么分析用户行为,标题自带传播力。内容有具体的行为列表和样本量,不是空谈。我会先打个折:这不是模型发布或重大能力更新,所以放在 featured 档位刚好,不用拔到 breaking。对从业者来说,能从中看到 Anthropic 对“高质量使用”的定义,也能反推自己用 Claude 的方式在什么水平。

量子位 · 公众号

人大和至知研究院开源了 Claw Agent 的全套训练方案,连数据带模型和评测一起给了

人大和至知研究院放出了一个叫 ClawGym 的 Agent 训练框架,把数据、训练代码和模型权重都开源了。他们合成了 13500 条可执行的任务当训练数据,又做了 200 条任务的基准测试集。用这套东西训出来的 ClawGym-30B-A3B 模型,在他们自己的 ClawGym-Bench 上拿了 56.82 分,比 Qwen3-235B-A23B ...

推荐理由:这条消息对 Agent 开发者很实用。ClawGym 把数据、代码、模型检查点一起打包开源,不是又一个只有排行榜的项目。13.5K 合成任务规模不算大,但 200 个评测任务和 56.82 的得分给了明确的起点。我会先打个折:正文没披露合成任务的质量验证细节,也没说这个分数在实际业务场景里对应什么水平,所以别急着对标生产环境。但作为开源基建,它降低了复现和改造的门槛,值得关注。

AI HOT 精选

Codex 现在能自己管自己的聊天线程和并行任务了

OpenAI 的 Codex 界面新增了对话线程管理能力,可以自己创建、搜索、整理和固定聊天线程,还能为并行任务启动工作树。这条信息来自 X 上的用户分享,正文没披露具体实现方式、准确率或延迟数据,我会先打个折——目前看起来更像一个便利功能,而不是底层模型能力的升级。

推荐理由:HKR 三项都过:Codex 拿到了具体的线程管理和并行工作树机制,对编码 Agent 用户有实际价值。正文没披露适用范围、定价和性能数据,所以我会先打个折,放在 featured 偏低的位置。

AI HOT 精选

Codex 现在能远程操控你的 Windows 电脑了,目前还是早期体验

OpenAI 给 Codex 加上了 Windows 支持,你可以在手机上用 ChatGPT 应用启动、查看和指挥 Codex 在你 Windows 电脑上干活。官方说这是早期体验,正文没披露收费方式和具体开放范围,我会先打个折——稳定性、权限控制和延迟都还没经过大规模验证,别急着把重要任务全交给它。

推荐理由:OpenAI 给 Codex 加了 Windows 计算机使用功能,通过 ChatGPT 手机 App 来操控。正文交代了工作流程和早期体验状态,但没提权限、定价和推送范围,所以先放在 featured 这一档。

AI HOT 精选

OpenRouter 加了个服务器端工具,让模型直接生成文件补丁

OpenRouter 在 Responses API 里上线了 apply_patch 工具,模型可以生成 V4A 格式的 diff 来创建、修改或删除文件。服务器端会先校验 diff 语法,不用客户端自己折腾。正文没披露这个校验具体能拦住哪些错误,也没说支持哪些模型。

推荐理由:HKR 三项都过了:OpenRouter 这次更新给 coding agent 搭了条跨模型的补丁通道,用 V4A diff 加服务端校验,实用性很强。但它属于基础设施层面的改进,不是模型能力本身的突破,所以分数压在 72–77 这个区间。

5月29日星期五

The Verge · AI

Adobe 的对话式 AI 助手像个平庸的设计实习生

The Verge 提前试了 Adobe Firefly AI 助手的测试版。它不像常规 AI 工具那样直接生成图片或视频,而是充当一个中间人,用对话的方式替你操作 Adobe 的设计软件。作者说,助手解释每一步编辑思路时讲得很清楚,但最终做出来的效果并不让人满意。正文没提定价、正式上线时间,也没列出完整支持哪些软件。

推荐理由:我会先打个折:这是 The Verge 编辑亲自上手 Adobe Firefly AI Assistant 测试版的体验文,不是官方通稿。它能在 Adobe 设计软件里听指令改图,解释流程挺清楚,但成品确实一般,所以标题才叫“平庸的设计实习生”。这点先别太激动,正文没披露定价、什么时候正式上线、具体支持哪些应用,信息有缺口。不过它踩中了设计工作自动化的敏感点——能不能用、好不好用、会不会抢活,所以给到 featured 门槛的分数是合理的。

AI HOT 精选

小米开源 ControlFoley:给视频配音效,可以按你写的提示词或给的参考音频来

小米大模型应用团队放出了一个叫 ControlFoley 的视频音效生成模型,权重和代码都开源了。它主要解决一个问题:以前模型只能看画面自动猜配什么声音,创作者没法干预。ControlFoley 支持三种用法——用文字描述想要的音效、用文字强行覆盖画面里原有的声音、或者上传一段参考音频让它模仿音色和风格,同时还能保证声音和画面动作对得上。团队自己训了一...

推荐理由:ControlFoley 把视频拟音做成可控生成,还直接开源了全套,对创作者和开发者都挺友好。它不是那种刷榜的基础模型发布,但胜在任务明确、工具属性强,放在 featured 门槛附近是合理的。

量子位 · 公众号

腾讯放出 AI 游戏创作平台“Code Craft”,说句话就能生成 2D 或 3D 游戏

腾讯游戏公开了一个叫 Code Craft 的 AI 游戏创作平台,主打用自然语言描述就能直接生成可玩的 2D 或 3D 游戏。平台内置了一套规划知识库和技能系统,可以帮 AI 拆解复杂的游戏设计指令,还提供了可视化调参面板和超过两万个免费云端素材。官方说法是“下限零基础,上限肝大作”,意思是完全不会写代码的人也能上手,有经验的开发者也能用它搭出更完整...

推荐理由:HKR 三项都过了。标题和摘要给的信息够硬:自然语言生成可运行游戏、2D/3D 都支持、2 万多免费资产,对开发者来说省原型成本是实打实的吸引力。正文没披露收费方式、开放范围和模型能力上限,所以分数压在 featured 低段,不往上拔。

r/LocalLLaMA

Liquid AI 发布 LFM2.5-8B-A1B,一个 80 亿参数、支持 12.8 万 token 上下文的模型

Liquid AI 放出了新模型 LFM2.5-8B-A1B。它用 380 亿个 token 做预训练,之后又做了大规模强化学习,上下文窗口能塞进 12.8 万个 token。词汇表翻了一倍,对非拉丁语系的 token 切分更友好。模型已经挂在 Hugging Face 上。不过 Reddit 原帖被网络策略挡了,正文没披露具体的基准跑分、推理成本和强...

推荐理由:我会先打个折:正文没给任何跑分、许可证和部署限制,所以别急着下结论。亮点是 8B/A1B 这个尺寸配 128K 上下文,38T token 的预训练量也算扎实,加上大规模 RL 调过,对想在本地跑长文本、又不想烧太多卡的人有吸引力。但没基准测试就没法判断实际水平,这点先别太激动。

Latent Space

Anthropic 完成 650 亿美元 H 轮融资,估值冲到 9650 亿,同时发布 Opus 4.8 和动态工作流

Anthropic 今天放出了两个大消息。钱这边,他们完成了 650 亿美元的 H 轮融资,投后估值达到 9650 亿美元,领投方是 Altimeter、Dragoneer、Greenoaks 和 Sequoia。公司还首次披露年化收入已经超过 470 亿美元,这个数字去年 12 月才 90 亿,增速很猛。产品这边,他们发了 Claude Opus 4...

推荐理由:HKR 三项全中:这条把前沿实验室的巨额融资、新模型和代码工作流更新打包在一起。我按摘要里的 650 亿美元融资和 9650 亿美元估值来算,因为标题里的数字和正文对不上。

AI HOT 精选

Cursor 团队发了份开发者习惯报告,代码产出翻倍但别急着归功 AI

报告给了几个数:开发者每周写的代码从 3.6K 行涨到 8.6K 行,千行以上的大 PR 占比也高了。AI 智能体单次会话里调工具的次数多了约 30%,说明它在接更复杂的活。被采纳的 AI 代码 60 分钟后还在代码库里的比例从 76% 提到 81%,留存确实在变好。不过正文没披露样本量、统计口径和是否排除自动生成代码,我会先打个折看这些数字。

推荐理由:我会先打个折,这是 Cursor 自家的报告,不是第三方审计,数字可能有美化。但 3.6K 到 8.6K 的翻倍和工具调用涨 30% 这两个点,对开发者判断 AI 编程工具的实际提效幅度有参考价值。正文没披露统计口径和样本量,这点先别太激动。整体不是产品发布或跨源事件,放在 featured 档、81 分比较合适。

阮一峰的网络日志

Token 费用难以负担

OpenAI 员工晒出自己一个月的 Token 用量:760 万次请求,6030 亿 Token,按公开费率算价值 130 万美元。虽然他是内部员工不用掏钱,但这个量级让外界看清了一件事——如果放开让程序员用顶级模型,一个人一年光 Token 费就可能上亿人民币。换成国内便宜的开源模型,也要两三百万。Uber 今年头四个月就烧完了全年 34 亿美元的 ...

推荐理由:Peter Steinberger的CodexBar使用数据把Token费用问题算成了一笔明账:一个月760万次请求、6030亿Token,按预设费率估算价值130万美元。这个数字够具体,也够吓人,直接点出了AI编程工具在规模化使用时的成本压力。文章不是产品发布或模型评测,而是从业者的真实账单分享,对正在评估AI工具成本的团队来说,比任何公关稿都实在。

AI HOT 精选

阶跃星辰开源 Step 3.7 Flash,198B 参数 MoE 模型,活跃参数约 11B,专为智能体工作流做效率优化

阶跃星辰放出了一个开源模型 Step 3.7 Flash,架构是 198B 参数的 MoE(混合专家),实际干活时只激活大约 11B 参数,所以跑起来相对轻量。上下文窗口给到 256K,能读图、读文档,也能直接生成代码或调用工具。它在 ClawEval-1.1 上拿了 67.1 分,SimpleVQA Search 上 79.2 分,这两个榜目前排第一...

推荐理由:这条发布的核心卖点是“大模型的身子,小模型的成本”,198B MoE 只激活 11B 参数,对想把模型塞进智能体流程的人吸引力很直接。256K 上下文和 ClawEval-1.1 的 67.1 分给了可查的硬数字,不是纯宣传。不过正文没提独立评测和实际延迟数据,这点先别太激动。整体信息量够、有记忆点,放在 featured 合适。

AI HOT 精选

技能提炼:让大模型写操作手册,小模型照着干活

作者 Tomasz Tunguz 分享了他用“技能提炼”让本地小模型跑个人工作流的做法。他会让 Opus 4.7、GPT-5.1 或 Gemini 3 Pro 这类顶尖模型,把处理邮件、管投资 pipeline、发博客等任务写成标准化的 SKILL.md 步骤文件,然后由本地运行的 Qwen 35B 或 Gemma 26B 一步步执行。这套系统基于 P...

推荐理由:这个技能提炼模式把大模型当教练、本地模型当执行者,思路清楚,对控制成本有实际意义。我会先打个折,因为文章没披露任何量化结果——不知道本地模型执行时会不会翻车,也不知道到底省了多少钱。这点先别太激动,等有数据再说。

Latent Space

异步 Agent 时代来了:Cognition 的 Walden Yan 和 OpenInspect 的 Cole Murray 聊背景干活、从需求直接到...

这期播客聊的是 AI 编程工具正在从“在编辑器里帮你补全代码”转向“在后台独立完成整个任务”。Cognition 的首席产品官 Walden Yan 和 OpenInspect 的 Cole Murray 分享了他们看到的趋势:Devin 合并的 PR 数量涨了 7 倍,Cognition 自家仓库里由 AI 生成的提交占比从 16% 飙升到了 80%...

推荐理由:H、K、R 三项都站得住:Cognition 自家仓库的数据让这篇访谈不只是 agent 口号。分数留在 78 分,因为它本质还是访谈和趋势观察,不是重大模型或产品发布。

TechCrunch · AI

Anthropic 发了 Opus 4.8,带了个能调度一群子模型干活的动态工作流工具

Opus 4.8 这次配了一个叫 Dynamic Workflows 的工具,核心作用是让一个主模型像工头一样,协调一堆子模型分头执行任务。正文没提价格、上下文窗口多大、跑分成绩,也没说什么时候能用上。

推荐理由:Anthropic 发新模型还配了个管 agent 群的工具,信息量够上当天重要档位。但价格、窗口大小、什么时候能用全都没说,我会先打个折,等这些补上再往上调。

5月28日星期四

AI HOT 精选

Perplexity 的 Computer 功能现在能直接嵌进 Word、Excel、PPT 和 Outlook 的侧边栏用了

Perplexity 把它的 Computer 助手塞进了微软 Office 套件里。你在 Excel、Word、PowerPoint 和 Outlook 的侧边栏就能直接使唤它,让它帮你起草文档、处理数据模型、做演示文稿或者打理邮件。正文没披露具体是哪个版本的 Office 支持,也没提需不需要额外付费。

推荐理由:Perplexity Computer 进了 Excel、Word、PPT 和 Outlook,能在侧边栏帮你起草文档、搭模型、做演示、处理邮件。这事本身有信息量,也戳中了办公 agent 入口的竞争点。但正文没提定价、权限控制、企业部署方案和实际效果数据,所以我会先打个折,不往更高层级推。

The Verge · AI

CNN 起诉 Perplexity,指控其 AI 答案引擎直接复制付费墙后的文章

CNN 在纽约法院起诉了 AI 搜索公司 Perplexity,说它的 AI 答案工具会“逐字”复制 CNN 的报道,甚至把原本锁在付费墙后面的内容直接喂给用户。CNN 在诉状里提到,他们试过屏蔽 Perplexity 的爬虫,但对方没理会,照样抓取记者采写、编辑的内容,既没授权也没付钱。

推荐理由:CNN 告 Perplexity 这事,核心是 AI 搜索把付费内容直接吐给用户,还抄得一字不差。对从业者来说,这直接关系到模型输出怎么规避版权雷区,以及跟媒体谈授权时对方会拿什么说事。目前还只是起诉阶段,没判决也没产品改动,所以先别当定论看,但信号已经够强了。

量子位 · 公众号

用有限状态机给 GUI Agent 合成训练轨迹,每条成本压到 0.04 美元

这篇讲的是 AutoWebWorld 这个项目,它没有靠人工标注或大模型当裁判,而是用有限状态机(FSM)来定义网页的状态、前置条件和跳转规则,自动生成并验证 GUI Agent 的操作轨迹。最终合成了 29 个网页环境、875 个页面和 11663 条经过验证的轨迹,平均每条轨迹的成本大约 0.04 美元。正文没披露具体用了哪些模型做测试,也没给出任...

推荐理由:我会先打个折:这不是顶级大厂的发布,所以分数压在 78–84 的研究工具档位。但 H、K、R 三条都站得住。0.04 美元一条轨迹是个能让人点进去的数字;放出的环境和轨迹量不算小,而且 FSM 内置状态验证这个设计,比靠人标或 LLM 打分更可复现,对做 GUI 智能体的人有直接参考价值。

AI HOT 精选

Mistral 开源了一套搜索工具包,把数据灌入、检索和评测拆成可替换的模块

Mistral 发布了 Search Toolkit 的公开预览版,一个开源框架,把搜索系统拆成数据接入、检索和效果评估三层,每层都定义了统一接口。你可以把它部署在云上、本地机房或者边缘设备上,按需替换里面的组件。官方说这样能省掉重复造轮子的时间,但正文没给出具体的性能基准或延迟数据,实际效果还得自己测。

推荐理由:Mistral AI 把数据喂入、检索和效果评估打包成一个开源框架,叫 Search Toolkit,现在开放公共预览。我会先打个折:这不算大新闻,但信息量够。它支持云端、本地和边缘部署,意味着你可以在自己机器上跑,不用被绑在某个云上。正文没披露具体性能对比和延迟数据,所以别太激动,但开源加评估环节这点对想自己搭资料库的团队挺实用。

Mistral AI

Mistral 将 Le Chat 升级为统一智能体 Vibe,覆盖办公与编码

Mistral 把 Le Chat 升级为统一 AI 智能体 Vibe,一个许可同时覆盖办公与编码,原有对话、设置和套餐全部保留。Work Mode 支持企业知识搜索、结构化数据分析、文档报告生成、多步任务定时调度和可复用技能,可连接 Google Workspace、Outlook、SharePoint、Slack、GitHub 等。

推荐理由:原文完整披露了 Vibe 的工作模式、编码模式与 CLI 更新,可据此判断它如何接入现有工作流。

阿里技术 · 公众号

用两个 Git 仓库把周报、洞察和效能报表自动化,省掉 80% 的手工活

周志伟分享了一套项目管理方案:用两个 Git 仓库,配合 AI 编程助手、Shell 和 Python,把催周报、搬数据、画图表、出工程效能报告这些事自动化了。正文没披露具体实现细节和验证数据,但按他的说法,至少能省掉 80% 的手工跟进和报表工作。

推荐理由:我会先打个折:80% 这个数字正文没给验证方法,别当基准看。但思路本身很实在——用两个 Git 仓库当数据源,让 AI 编码助手加脚本去自动拉数据、出图表、拼周报,把项目经理从催收和搬运里解放出来。对 AI 从业者来说,这不是模型或平台发布,而是一个可抄作业的工作流改造,成本低、痛点准,所以给了 featured。

AI HOT 精选

Mistral 推出物理 AI 模型,用一张 GPU 几秒钟预测完整物理场

Mistral 整合了 Emmi AI 团队,发布了一个面向工业工程的物理 AI 基础模型。它能根据几何结构、边界条件或测量数据,在单张 GPU 上用几秒钟预测出完整的物理场(比如温度、应力分布)。正文没披露具体架构、参数量、训练数据规模和实测误差范围,也没给出跟传统数值仿真在精度和速度上的量化对比,所以实际工程可用性还得看后续验证。

推荐理由:Mistral 这次没发新聊天模型,而是直接拿下一个物理 AI 团队,做工业仿真。我会先打个折:正文没披露具体模型名、基准测试、定价和开放方式,所以没法判断它比现有求解器到底准不准、省多少。但方向本身值得关注——如果单 GPU 秒级出完整物理场是真的,对西门子能源这类重工业客户来说,仿真迭代速度会快很多,成本也可能降一截。这点先别太激动,等他们放出可复现的结果再说。

The Verge · AI

YouTube 上线 AI 自定义信息流:输入想看的内容描述,主页直接生成专属推荐

YouTube 开始在美国推一项新功能,让用户用自然语言描述想看什么,AI 会根据兴趣、心情或话题生成一个定制视频流,并可以固定在主页顶部方便回看。目前只支持英文,登录后的美国用户在手机 App 和桌面端都能用,入口在主页顶部的“Your custom feed”标签。正文没披露这个 AI 具体用了什么模型、怎么平衡推荐算法和用户主动描述,也没提生成速...

推荐理由:YouTube 这次不是微调推荐,而是让用户自己写提示词来拼一个视频流,交互上往前走了一步。我会先打个折:正文没提背后用了什么模型、怎么排序、效果数据也没有,所以暂时只能当一次产品实验看。上线范围限美国、英语、已登录用户,说明还在试探阶段,别急着当成全面开放。如果是真的能稳定跑通,对内容分发逻辑的冲击不小,但现在信息缺口还很大。

FT · 科技

律所 Kirkland & Ellis 要花 5 亿美元自建 AI 平台

这家顶级律所计划投入 5 亿美元,把全所律师的“集体智慧”做成一个内部 AI 平台。正文没披露具体用哪家模型、是自己从头训还是拿现成模型调优,也没说什么时候上线。5 亿这个数字说明他们打算把这件事当成核心基础设施来搞,不是小范围试点。不过,没看到技术细节和验证指标之前,这笔钱到底能省多少人工、提多少效率,还不好判断。

推荐理由:FT 的信源加上 5 亿美元这个数,让这条消息在律所 AI 应用里算个大新闻,所以 H/K/R 都给了肯定。但正文没披露任何技术细节,连用的是大模型还是传统 NLP 都没说,我会先打个折。整体判断是:话题性够强,信息量偏弱,适合放在企业应用动态里让人留意,别当技术突破看。

AI HOT 精选

xAI 把最快的编程模型 Grok Build 0.1 放上 API 公测了

xAI 发布了专门干编程活的模型 grok-build-0.1,现在通过 API 公测。这个模型主要用来做网页开发、修 bug 这类需要模型自己调用工具、跑流程的任务,跟 Grok Build 命令行工具背后是同一个模型。速度标称每秒 100 个 token 以上,价格是输入每百万 token 1 美元、输出每百万 token 2 美元。除了写代码,官...

推荐理由:我会先打个折:这是 0.1 公测版,正文没披露基准测试成绩、上下文窗口大小和具体任务成功率,所以别急着把它当成成熟产品。但亮点很实在——速度标到 100+ tokens/秒,定价也直接亮出来,输入 $1/M、输出 $2/M,对想试编码智能体的团队来说,成本门槛不高。xAI 明显在抢 Cursor/Claude 的开发者心智,这点从定位就能看出来。综合看,信息量够、有价格锚点,但缺验证数据,给 78 分、featured 不 p1 是合理的。

AI HOT 精选

Cognition AI 拿了超 10 亿美元,投前估值 260 亿,想把软件工程师效率提 10 倍

Cognition AI 新融了超过 10 亿美元,投前估值 260 亿美元。它的年化收入一年里从 3700 万美元涨到约 4.92 亿美元,涨了十几倍。核心产品 Devin 被定位成能自主干活的初级工程师,不是只补代码,而是能自己规划、测试、部署,走完多步骤流程。公司不绑死一家模型,既用自己的模型,也接 OpenAI 和 Anthropic 的大模型...

推荐理由:这条消息硬数字够多,估值和收入增速都摆在那,Devin 的定位也从“写代码助手”变成了能自己规划、测试、部署的初级工程师,对从业者的冲击感很直接。不过信息源单一,正文没披露具体投资方和估值计算细节,所以没给到行业地震级的高分。

AI HOT 精选

OpenAI 产品现在能直连你内网的 MCP 服务器了

OpenAI 给 ChatGPT、Codex 和 Responses API 加了个能力:可以走纯出站 HTTPS 去调你团队放在内网的 MCP 服务器。服务器不用暴露到公网,模型这边只往外发请求,不接收入站连接。正文没提延迟和鉴权细节,实际部署前最好先测一下链路稳定性。

推荐理由:我会先打个折:正文没披露权限控制怎么配、收不收费、什么时候全量推,这些缺口让实际落地还有变数。但方向很明确——让模型直接进公司内网干活,而且用仅出站 HTTPS 绕过了安全团队最头疼的入站暴露问题。对正在评估 AI agent 接内部系统的团队来说,这是个值得马上跟进的消息。

AI HOT 精选

Anthropic 发布 AI 智能体零信任安全框架

Anthropic 发了篇博客,讲企业里用自主 AI 智能体(能自己调用工具、读写记忆的模型)该怎么搞安全。核心判断是:前沿模型把漏洞利用的时间从几个月压到了几小时,老一套安全流程跟不上。文章给了一套三层零信任架构,把智能体拆成身份层、工具层和记忆层分别做权限最小化,还列了八个阶段的落地步骤。威胁模型里重点提了提示注入、工具投毒和记忆投毒这三种攻击方式...

推荐理由:Anthropic 这份零信任框架把攻击速度的变化说得很直白——前沿模型能把漏洞利用周期从几个月压到几小时,这个数字本身就是最好的警示。三层架构和八阶段流程让方案有了骨架,提示注入这些威胁也点得实在。我会先打个折:正文没披露具体验证数据或落地案例,目前更像一套设计原则而非实测报告。但安全、智能体、权限这几个话题叠加,对正在推 agent 上线的团队来说,参考价值不低。

AI HOT 精选

Google Pay 更新:让 AI 代理替你跑支付流程,安卓端也能一键结账了

Google Pay 这次更新主要干了两件事:一是把支付系统开放给 AI 代理,二是把安卓和桌面端的结账体验做得更顺滑。先说 AI 这块,他们搞了个通用商业协议(UCP),你现有的商户号和支付后台不用动,就能让 AI 代理直接调用支付能力去完成交易。还发了个 MCP 服务器(公开预览版),相当于给开发用的 AI 助手配了个支付插件,能帮你查集成问题、分...

推荐理由:我会先打个折:正文只列了功能点,没给实际采用规模、定价,也没展示一个真实的 agent 交易案例,所以分数卡在 72–77 这个区间。但 MCP 支付这个方向本身够具体,对 agent 商业化的推动力是实打实的,值得放进 featured。

AI HOT 精选

Google 搜索产品 VP 聊 AI 原生搜索:新模式怎么跑、成本多高、出版商怎么办

Robby Stein 在 Google I/O 上谈了搜索正在从列链接转向直接给答案的 AI 原生模式。AI Mode 会把复杂问题拆成多轮搜索去查,背后跑在 Google 自己的 TPU 上,推理成本不低,但正文没给具体数字。搜索量没降反升,这点他提了但没展开数据。关于答案里引用哪些信息源和链接,有一套选择逻辑,但没细说权重。出版商最关心的流量问题...

推荐理由:这是一篇访谈摘要,不是产品发布,所以我会先打个折。HKR 三个维度都踩中了,但正文没披露具体价格、流量数字或成本数据,判断只能停在“高质量访谈”这个区间。文章把 Google 转向 AI 原生搜索的几个矛盾摆得很清楚:想用多轮对话和 AI Mode 留住用户,又得面对 TPU 成本高和出版商怕被截流的现实。信息够硬,但缺量化验证,所以分数给到 74 是合理的。

5月27日星期三

The Verge · AI

Robinhood 开放接口,允许 AI 代理直接帮你炒股

Robinhood 宣布允许用户创建独立账户,划拨一笔钱后,让 AI 代理(也就是能自主执行任务的模型)直接买卖股票。Robinhood 自己也在风险提示里写得很直白:AI 交易可能导致全部本金亏光。正文没披露这个 AI 代理具体是 Robinhood 自研还是第三方模型,也没说交易策略由谁提供。

推荐理由:Robinhood 这次不是开放行情数据,而是直接让 AI agent 进场下单。用户给 agent 单开账户、注入指定资金,agent 就能自主买卖股票。我会先打个折:正文没披露风控细节、回撤限制、交易频率上限,也没说 agent 跑在什么模型上、能不能接外部信号。所以“赚很多或赔很多”目前更像产品定位,不是实测结论。但这件事本身信号很强——交易权限从人移交到 agent,合规和客诉风险会成倍放大。

AI HOT 精选

Runway 发布 MCP 服务器,让 Claude、ChatGPT 这类助手能直接在对话框里帮你生图和剪视频

Runway 推出了一个 MCP 服务器,相当于给 AI 助手装了个插件,让 Claude、ChatGPT、Cursor 等工具能在聊天窗口里直接调用 Runway 的模型生成图片和视频。你不用再切换软件,给助手扔一个商品链接、一张参考图或一段文字描述,它就能把成品返回到同一个对话框里。这次接入的模型包括 Gen-4.5、Seedance 2.0、GP...

推荐理由:这条消息的钩子很直接——Runway 的视频能力进了程序员和创作者天天用的对话工具。技术上不是模型突破,而是集成方式变了,MCP 服务器当中间人,让多个模型被一个入口调度。对从业者来说,这比单纯发个新模型更贴近实际工作流,所以 HKR 三项都成立。不过正文没提延迟、并发限制和计费方式,实际体验还得观望。整体算一次产品整合更新,重要性给 76 分,放在 featured 里合理。

TechCrunch · AI

Robinhood 开始让 AI 代理替你炒股了

Robinhood 给用户开了个口子:你可以创建一个独立账户,连上一个专用钱包,让 AI 代理(也就是能自己干活的小程序)去读你的持仓、分析行情、出策略、推股票。但下单的钱只能从这个钱包里扣,动不了你主账户里的资金。每笔交易都会推通知,有些单子还得你点一下确认才会执行。正文没披露代理的决策模型具体怎么搭、回测表现如何,也没说风控和止损机制。Robinh...

推荐理由:我会先打个折:Robinhood 不是前沿 AI 实验室,所以这条消息的份量更多在产品落地层面。但它的机制设计很实在——代理能看组合、能分析,但动钱时只能碰你专门划拨的那一小块余额,不是整个账户敞开了让它玩。这点先别太激动,正文没披露代理具体用什么模型、分析能力有多深,但光是“代理+真实资金+预存钱包”这个组合,就足够让做 agent 安全的人盯一阵了。

阿里技术 · 公众号

阿里吕若凡聊 Agent Room:让多个 AI 共享上下文和任务账本,从跑流程进化到协作判断

这篇文章讲的是阿里技术专家吕若凡提出的 Agent Room 模型。核心想法是不再让 AI 智能体各干各的,而是把它们放进一个共享上下文、任务账本、记忆和产物的“房间”里协作。文章用两个软件工程案例做了验证,说明这套系统不是简单地把任务分发给不同模型,而是让它们能基于共享信息做出协作判断。不过正文因为微信环境验证问题没能加载出来,具体的技术细节、实验数...

推荐理由:这是一篇方法论文章,不是模型发布或开源框架,但 Agent Room 的机制和两个研发现场让它有干货。HKR 三项都踩中了,我会给到 76 分,放在 featured 里。

纽约时报中文网

谷歌怎么从 AI 掉队变成领跑的?

两年前谷歌的 AI 还在建议人吃石头、往披萨上抹胶水,现在它的聊天机器人 Gemini 月活用户已经冲到 9 亿,跟 OpenAI 自报的 ChatGPT 用户数打平。谷歌没把 Gemini 当独立产品养,而是直接塞进 Gmail、地图、Google.com 这些每天被几十亿人用的服务里,连苹果 Siri 未来的底层技术也换成了它,等于 Gemini ...

推荐理由:HKR三项全中。文章用逆袭主线把谷歌从掉队拉到能打的位置,钩子够强;9亿用户、770亿广告收入、Siri合作这些数字和信息量扎实,不是空谈;对从业者来说,模型竞争格局和分发渠道的变动直接关系工作判断,相关性高。整体是产业分析而非模型发布,放在78-84分档合理。

新智元 · 公众号

OpenRouter 月吞 100 万亿 Token,刚拿了 1.13 亿美元 B 轮融资

OpenRouter 做的是 AI 模型的“中转站”,用一个 API 就能调用 400 多个模型。现在每周处理 25 万亿 Token,一个月差不多 100 万亿。这轮融资由 CapitalG 领投,估值到了 13 亿美元。正文没披露具体盈利和成本结构,所以“赚爆了”这个说法先打个折,但流量规模确实大。

推荐理由:这条融资消息我会先打个折,毕竟不是技术突破,但100万亿月token这个量级确实把“模型路由”这门生意做实了。正文没披露利润率或抽成比例,所以别急着说它暴利,但400多个模型接入、每周25万亿token的吞吐量,说明开发者已经在用脚投票。对从业者来说,这比某个新模型跑分更有参考价值——它告诉你钱和流量正往基础设施层聚。

AI HOT 精选

Anthropic 在伦敦发布了两项让 Claude 自己动手干活的新功能:自托管沙盒和 MCP 隧道

Anthropic 在 Code w/ Claude 伦敦活动上宣布了两项 Claude 托管代理的新能力。一个是自托管沙盒,公开测试版,让 Claude 能在你自己的安全环境里跑代码、操作浏览器,不用把敏感数据交给第三方;另一个是 MCP 隧道,研究预览版,相当于给 Claude 开了条加密通道,让它能直接连到你本地或私有网络里的工具和数据源。Spo...

推荐理由:Anthropic 官方产品更新,在伦敦活动上发布了 Claude 托管代理的两项具体能力。我会先打个折:这不是新模型发布,而是开发者工具层面的迭代,所以重要性给到 78。自托管沙箱让代理在隔离环境里跑代码,MCP 隧道则打通了本地工具和云端代理的连接,对实际干活的人比刷榜分数更有用。正文没披露沙箱的安全隔离具体到什么程度,这点先别太激动。