跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 821–840 条 · 共 1,465 条

5月22日星期五

新智元 · 公众号

微软投了 OpenAI 130 亿,自家工程师用 Claude Code 把账本烧穿了

微软计划在 6 月底前停掉体验与设备团队的 Claude Code 订阅,把近 10 万工程师迁到 GitHub Copilot CLI。文章把原因归结为外部按 token 计费的成本太高,但正文因为需要验证码没加载出来,具体烧了多少钱、内部怎么讨论的都没看到。

推荐理由:我会先打个折:这不是模型发布或官方重大产品更新,更像一次内部成本管控动作。但 HKR 三项都站得住——微软投 OpenAI 又禁 Claude Code 的对比很抓人,时间、人数、计费原因都给了,而且直接踩中编程助手在企业里怎么省钱的痛点。正文没披露具体账单金额,所以别把省钱效果说死。整体适合放在 featured 位置,81 分合理。

新智元 · 公众号

Anthropic 更新了 Agent 架构,但正文被验证页挡住了,没法确认具体改了什么

这篇文章的链接点进去只显示“环境异常,需要验证”,正文内容完全看不到。从已有的英文摘要看,阿里云的 JVS Crew 把 Agent、环境和会话拆成了三层,加了沙盒、快照恢复、权限控制和按量计费;Anthropic 在 5 月 19 号给 Claude 托管 Agent 加了自托管沙盒。文章还提到几个国内客户案例,说部署周期两周,效率提升 5 到 10...

推荐理由:文章把阿里云 JVS Crew 和 Anthropic 的沙箱更新放在一起比,讲的是企业级 agent 基础设施怎么落地。有具体架构细节,也有安全与计费的讨论,对正在选型或关注 agent 生产化的从业者有用。不过 Anthropic 那部分信息偏薄,正文没展开 self-hosted sandboxes 的限制和实际表现,这点先别太激动。整体属于值得一看的产品对比,不是必写的模型发布。

AI HOT 精选

OpenAI Codex 的 /goal 模式转正了,现在可以给 AI 派跨小时甚至跨天的长任务

OpenAI 把 Codex 里的 /goal 模式从实验功能升级成了稳定版。你可以在 Codex 应用、IDE 插件或命令行里用,设定好里程碑后,AI 会自己跑任务,持续几小时甚至几天。中间能随时查看进度、改方向或暂停。用之前要升级应用并打开这个功能(命令行或手动改配置文件都行),开启后在输入框就能管理任务,侧边对话可以看进度,不会打断主任务。正文没...

推荐理由:我会先打个折:文章只说了功能转正和多端支持,但没披露任务失败怎么恢复、资源消耗上限、以及哪些套餐能用。对想试的人,知道它能跑长任务就够了;对想上线用的人,信息缺口还很大。所以放在 featured 低段,等后续补上安全和成本细节再往上调。

Hacker News 首页

sddw:给 Claude Code 加一套分步写规格、清上下文的开发流程

作者开源了一个 Claude Code 插件,把开发任务拆成需求、代码分析、设计三份规格文档,再把实现切成多个子任务逐个做。每完成一个步骤就清一次上下文,目的是让模型每次只盯一小块,减少跑偏,也省 token 钱。规格文件落地到磁盘,方便断点续传,也能在早期发现模型理解错的地方。正文没给出具体省了多少成本或性能提升的量化数据,这点先别太激动。

推荐理由:我会先打个折:正文没给性能对比、没披露实际省了多少 token、也没说在复杂项目上的表现,所以不能给太高。但三层规格加每步清上下文这个组合拳,确实戳中了用 Claude Code 写代码时上下文越跑越偏、账单越来越贵的真实问题。对正在折腾 coding agent 的人来说,这个思路值得看一眼,只是别指望拿来就能用,还得自己踩坑验证。

机器之心 · 公众号

CVPR 2026 | HiF-VLA:用视频压缩的思路教机器人“边看动作边想下一步”

西湖大学团队搞了个叫 HiF-VLA 的框架,核心想法是把机器人看世界的方式从“一帧帧静态图”换成“画面怎么动的”。它直接用 H.264 这类视频编码器从画面里提取紧凑的运动向量,再让一个联合专家模型同时预测未来的视觉动态和该做的动作序列。论文里给的数据是,在设定的历史窗口下,显存峰值 31.4GB,延迟 117.7 毫秒。不过正文因为环境验证问题没加...

推荐理由:这篇 HiF-VLA 我会先打个折:它还是一个单篇研究,没有落地案例或多方交叉验证,所以放在 featured 低位。但它的思路确实比多数 VLA 论文更“省”——直接用 H.264 运动向量代替逐帧视觉编码,把“看变化”和“想动作”塞进联合专家里一起算,显存压到 31.4GB、延迟 117.7ms,对想在真机上跑实时推理的团队是个可参考的方向。正文没披露在真实机械臂上的成功率或与主流 VLA 的 head-to-head 对比,这点先别太激动。

Computing Life · Share · 鸭哥调研

DS4 引擎让 DeepSeek V4 Flash 在 Mac 上跑起来了,还解决了 agent 对话的“失忆”问题

DeepSeek V4 Flash 是个 284B 总参数、13B 激活的 MoE 模型,性能接近前沿水平,但主流推理引擎在 Mac 上都跑不了。antirez 专门为它写了 DS4 引擎,纯 C、Metal 优先,一个编译命令就能用。它最特别的地方是解决了 agent 工作流里的上下文断裂:模型生成工具调用时,DS4 会记住原话,下次 agent 返...

推荐理由:标题和摘要给的期待是“在 Mac 上本地跑 DeepSeek V4 Flash 的实操方案”,但正文只列了 DS4 引擎的三项机制名称,没给出模型大小、实际性能、Mac 兼容性要求,也没有可复现的测试结果。我会先打个折:对想动手试的开发者来说,知道有这些机制存在已经算有用信息,但离“能照着做”还差关键数据。H、K、R 三项都踩中了,信息缺口也明显,放在 featured 层级刚好——够吸引人点进去看,但读完会发现缺胳膊少腿。

AI HOT 精选

可塑界面:AI 让软件界面按需变形,不再只有一种固定样子

Salesforce 已经“砍掉”了传统界面,销售不用登录网站就能通过 AI 更新交易记录。作者把这种趋势叫做“可塑界面”——AI 能根据你当下在干嘛,动态生成最适合的交互形式,比如开车时给你念邮件摘要、审文案时弹出网页应用、做预算时直接给个带图表的表格。文章引用了 Airbnb CEO 和 Anthropic 工程师的观点,认为纯文本对话不够用,电商...

推荐理由:我会先打个折:这篇是软件形态的展望,没有上线时间、用户数据或可复现的测试,所以放在评论类里刚好。正文说 Salesforce 已经用无头架构让销售靠 AI 直接改数据,界面不再写死,而是按场景动态生成 HTML、音频甚至网页。这点先别太激动——正文没披露这套动态生成在 Salesforce 里的实际覆盖范围、延迟和出错率,也没说 MCP 具体怎么接。但思路本身对做 B 端产品的人有用,因为它把“界面”从设计稿变成了模型输出,省不省开发成本另说,至少交互逻辑要重想。

AI HOT 精选

Claude Code v2.1.147 新增 Workflow 工具,/simplify 改名 /code-review 并支持生成 PR 行内评论

Claude Code 发了 v2.1.147。这次加了一个叫 Workflow 的新工具,默认是关着的,用来做确定性的多智能体编排——你可以把它理解成让多个 AI 助手按固定流程协作干活,而不是自由发挥。另一个变化是把原来的 /simplify 命令改成了 /code-review,功能也升级了:现在会报告代码正确性,还能直接在 GitHub PR ...

推荐理由:这是 Claude Code 的一个小版本更新,但 Workflow 工具的加入让产品从单智能体往多智能体协作迈了一步。工具默认关闭,说明还在试探阶段,正文没披露性能数据、定价或使用范围,所以先别太激动。把 /simplify 改名为 /code-review 也更直白,知道是拿来审代码的。整体看,对关注编码智能体稳定性的从业者是个值得留意的信号。

Latent Space

给 AI 智能体配台电脑:Daytona 创始人聊 60 毫秒启动、85 万次日均运行的沙箱生意

Daytona 做的不是简单的代码执行盒,而是给 AI 智能体用的“可组合电脑”。他们的沙箱最快 60 毫秒就能启动一个,5 万个沙箱大约 75 秒就能跑起来,最大的客户一天要跑将近 85 万个沙箱。创始人 Ivan Burazin 从十多年前就在喊“干掉本地开发环境”,现在 AI 智能体成了他理想的落地场景:智能体不在乎你的笔记本配置,它只需要一个能...

推荐理由:我会先打个折:这是创业公司的基础设施故事,不是大模型或平台级发布。但 HKR 三项都站得住——标题有钩子,性能数字实在,痛点也踩得准。正文没披露客户名字和具体成本,这点先别太激动。

AI HOT 精选

Datasette Agent 发布:给数据库配了个能聊能画图的 AI 助手

Simon Willison 把做了三年的 LLM 库和 Datasette 数据库工具终于接上了,发布了 Datasette Agent。你可以直接用对话的方式问数据库里的问题,比如“我最近一次看到鹈鹕是什么时候”,它会自己写 SQL 去查。配合插件还能自动生成图表、用 ChatGPT 画图,或者在沙箱里跑代码。线上演示跑的是 Gemini 3.1 ...

推荐理由:Datasette 给自家工具加了个能聊天的 agent,支持插件画图,还能选 Gemini 3.1 Flash-Lite 或 LM Studio 本地模型。对搞数据的人来说,这比大厂发新模型更实在——它解决的是“我能不能在自己机器上安全地用 AI 查数据”的问题。不过正文没披露本地模型的具体效果和延迟,这点先别太激动。整体看,实用性强但受众偏窄,放在 featured 里合适。

AI HOT 精选

Codex 现在能远程操控锁屏的 Mac,手机就能指挥它干活

OpenAI 开发者账号发帖说,Codex 可以在 Mac 锁屏、屏幕关闭的情况下,通过手机安全地使用 Mac 上的应用。帖子没提权限边界、怎么收费、什么时候上线,我会先打个折——正文只给了一个文档链接,具体怎么实现“安全”也没展开。

推荐理由:HKR 三项全中:OpenAI Devs 给出了 Codex 操控 Mac 的具体条件,但正文没披露权限边界、价格和发布时间,所以重要性停在 82 分,没上 85+。我会先打个折——这个功能听起来很省事,但没讲清楚锁屏下到底能碰哪些文件、会不会被滥用,这点先别太激动。

AI HOT 精选

谷歌发布 Kotlin 版和 Android 版 Agent 开发套件 0.1.0,让 AI 能在手机本地跑任务

谷歌把 Agent 开发套件(ADK)带到了 Kotlin 和 Android 上,版本号 0.1.0。Kotlin 版负责后端流程,Android 版则专门为手机端做了优化,能直接调用 Gemini Nano 这类本地模型干活。这套东西的核心是混合调度:你可以让云端大模型当总指挥,把涉及隐私的具体任务(比如查本地文件里的酒店预订)派给手机上的子 Ag...

推荐理由:Google 这次发了两个 ADK:Kotlin 版给后端搭 Agent 工作流,Android 版让 Agent 跑在手机上。版本号 0.1.0 说明还在早期,功能边界和稳定性都别抱太高期待。正文只交代了平台和版本,没给性能数据、实际案例或开发者规模,所以我会先打个折——方向对,但落地效果还得看后续。

Hacker News 首页

Runtime 给团队里每个人配一个沙盒编程助手,支持 Claude Code、Cursor 等主流工具

Runtime 做了一套开源的沙盒基础设施,让公司里不只有工程师能用编程助手,产品、设计、市场、客服也能在安全隔离的环境里让 AI 帮忙改代码、查数据、发 PR。它兼容 Claude Code、Codex、Cursor、Copilot、Gemini CLI 和 Devin 这些主流编程助手,可以接入公司自己的工具链(比如 Datadog、Salesfo...

推荐理由:我会先打个折:正文没披露实际客户或用量数据,所以别当成熟产品看。但它的切入点很准——企业不敢让编程代理直接跑在内部环境,Runtime 用沙盒把代理隔离开,还开源了基础设施,等于给团队一个低风险试水的入口。支持六种代理、不加价 token 的定价,也让成本更可预测。对正在评估编程代理的团队,这是个值得跟进的信号。

5月21日星期四

AI HOT 精选

Anthropic 快成第一家赚钱的 AI 实验室了,二季度预计营收 109 亿、运营利润 5.59 亿美元

华尔街日报的消息,Anthropic 二季度营收预计冲到 109 亿美元,同比增长 130%,运营利润约 5.59 亿美元,比它自己去年说的 2028 年前不盈利提前了不少。增长主要靠两件事:一是编程工具被大量公司用起来,二是 Claude 开始接那种能自己跑一段时间的“干活型”任务,需求大到算力一度不够用,逼着 Anthropic 去签新数据中心合同...

推荐理由:这条消息的钩子很清晰:Anthropic可能要成为第一个赚钱的头部AI实验室了。给出的数字挺吓人,单季营收109亿,运营利润5.59亿,如果属实,说明卖模型服务真的能跑通。但我会先打个折,因为这只是《华尔街日报》根据预测数据做的报道,不是官方审计后的财报,正文也没披露成本结构里算力烧了多少、企业客户贡献了多少。这点先别太激动,等正式文件出来再看。不过,光是“盈利”这两个字就足够让整个行业讨论一阵子了,所以优先级给到p1,重要性88分。

r/LocalLLaMA

Fireworks 提出“Agent 执行税”:浏览器智能体跑任务时,22.9% 的推理算力都浪费了

Fireworks 在 WebVoyager 上跑了 720 个浏览器智能体任务,发现平均有 22.9% 的推理调用属于无效消耗,他们管这个叫“Agent 执行税”——也就是为了完成任务,模型多做的无用功。具体到各家模型:MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍;GLM-5 的任务成功率做到 57.1%;Ki...

推荐理由:HKR 三项都站得住:它把一个跑分现象包装成了可复用的采购指标,有具体数字支撑,而且直接回应了从业者在选型时对隐性成本的焦虑。信源是 Fireworks 自己的博客和 Reddit 讨论,不是第三方独立评测,所以重要性停在 74 分 featured 档,没往上拉。

MIT Technology Review · AI

Anthropic 在伦敦办了一场开发者大会,近半数人举手说上周刚发过完全由 Claude 写的代码,而且很多人没看就直接上线了

Anthropic 在伦敦的 Code with Claude 大会上展示了一个趋势:开发者越来越愿意把写代码的活直接交给 AI。工程师 Jeremy Hadfield 在现场问谁上周发过完全由 Claude 写的 pull request(提交审核的代码改动),近一半人举手;再问谁没读代码就直接发了,大部分手还举着。Anthropic 说公司内部大部...

推荐理由:这篇 MIT Tech Review 的现场报道不是产品发布稿,但抓到了一个很实的信号:开发者已经在把 Claude 写的代码直接往仓库里合,而且不少人连看都不看。我会先打个折,这个数字来自活动现场举手统计,样本量和代表性都有限,不能直接推成行业常态。但“近一半”这个比例还是够高,说明在重度用户里,对 AI 代码的信任已经跨过了一道心理门槛。文章没给 PR 的复杂度或后续回滚率,这点信息缺口让判断只能停在“行为在发生”而不是“行为没问题”。整体适合放进 featured,因为它比功能更新更能让人停下来想一下自己的工作流。

The Verge · AI

我用谷歌 AI Studio 一个下午“氛围编程”搞出了三个安卓 App,第一个只靠 148 个字的提示词

The Verge 的编辑 Sean Hollister 用谷歌 AI Studio 试了一把“氛围编程”,一个下午生成了三个安卓 App。其中一个 App 他只输入了 148 个字的提示词,大概 10 分钟后就在自己的安卓手机上装好跑起来了。前提是他提前把手机开了 USB 调试模式并连上电脑,剩下的活 AI Studio 全包了。他感叹这速度让他差点...

推荐理由:这不是 Google 官方大发布,而是一篇带实测细节的第一人称体验文,有梗有数字,适合放进精选。

AI HOT 精选

Cursor 复盘云端智能体踩坑史:环境没配好,模型再强也白搭

Cursor 团队把云端智能体从本地搬到服务器上跑了一年,最大的教训是:开发环境本身就是产品。本地跑的时候,模型直接继承你电脑上的全套工具链,但云端得从零重建,缺个依赖、少个配置,模型不会报错,只会悄悄变笨。他们后来把任务调度迁到 Temporal 上,可靠性从 99% 拉到了 99.9% 以上,现在平台每天处理超过 5000 万次操作。文章还聊了怎么...

推荐理由:HKR 三项都成立:Cursor 在编程 agent 圈子里是核心玩家,文章给出了 Temporal 迁移、99.9%+ 可靠性和 5000 万次日操作量这些实打实的数据。不是产品发布,所以放在 featured 低段位。

阿里技术 · 公众号

从零搭一个 Agent:原理拆解与个人助手实操

这篇文章因为微信环境异常,正文内容没抓到,只看到标题和作者信息。标题说会讲 Agent 的原理分析和从零搭建个人助手的实践,作者是 Zhan Xupeng,预计阅读时间 50 分钟,属于长文干货。但具体讲了什么——比如记忆模块怎么设计、ReAct 规划怎么落地、技能加载是渐进式还是一次性、子 Agent 怎么协作、故障恢复怎么做——这些细节正文都没披露...

推荐理由:我会先打个折:标题确实平平无奇,像又一篇入门教程。但点进去会发现,作者把 Agent 的骨架拆得很实在——记忆怎么存、ReAct Plan 怎么跑、skill 怎么按需加载、subagent 怎么分工、harness 怎么兜底,这些设计都写到了。对正在折腾个人助手或想让 Agent 稳定跑业务的同学来说,这篇比大多数水文有料。不过正文没给出量化验证,效果到底怎么样还得自己试。

新智元 · 公众号

Anthropic 买下 SDK 工具商 Stainless,OpenAI 等客户得自己维护代码库了

Anthropic 把 Stainless 给收购了。Stainless 是一家专门帮公司自动生成和维护 API 的 SDK(软件开发工具包)的公司,OpenAI、Meta、Cloudflare 之前都是它的客户。收购之后,Stainless 会关掉它的托管产品,也不再给老客户提供后续支持。不过,之前已经生成的 SDK 代码所有权还归客户自己,只是后续...

推荐理由:我会先打个折:这不是模型发布或核心能力更新,所以分数不会顶满。但 Anthropic 这手挺狠,Stainless 是给 API 自动生成 SDK 的,全球据说四分之一开发者都在用,客户包括 OpenAI 和 Meta。收购后 Anthropic 直接要把托管产品关停,等于断了竞争对手一条现成的开发者工具链。正文没披露收购金额和具体关停时间表,但光是“断供 OpenAI”这个动作,就够让依赖这套工具的团队紧张一阵了。