跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1081–1100 条 · 共 1,465 条

5月7日星期四

Ben's Bites

Elon 把用量翻倍了

这期主要讲了几件事。ChatGPT 免费版换上了新模型 GPT-5.5 Instant,看 PDF、搜网页、调用记忆都比上一代强,在容易出错的场景下幻觉减少了 52.5%,回复也更短、更少用表情。同时 ChatGPT 现在能直接嵌进 Excel 和 Google Sheets 里写公式、分析表格。Claude 这边,所有付费套餐的调用额度翻倍,原因是 ...

推荐理由:HKR 三项都过了:SpaceX Colossus 1 的算力合作、Claude 用量翻倍、配额压力,全是实打实的信息点。正文没给出具体限额数字和定价变化,也没说清楚是哪些付费档位受益,所以重要性停在低 featured 档。标题写 Elon 但正文没展开,这点先别太激动。

AI HOT 精选

OpenRouter 推出统一网络搜索与抓取工具,换模型不用重写工具代码

OpenRouter 发布了两个服务端工具:`openrouter:web_search` 和 `openrouter:web_fetch`。模型在对话中需要查资料时,可以直接调用它们,由 OpenRouter 在后台执行搜索或抓取网页,再把结果喂回模型。最大的好处是换模型不用改工具定义——不管底层跑的是 GPT-5.5、Claude 还是 Kimi,...

推荐理由:我会先打个折:正文没披露具体接了哪些搜索引擎和抓取引擎,也没提价格和调用限额,所以实际能用成什么样还得等上线看。但这件事的看点不在引擎本身,而在跨模型工具接口的一致性——让 GPT、Claude 等模型用同一套搜索和抓取指令干活,对搭 agent 工作流的人来说省了不少适配成本。这点先别太激动,但如果后续把引擎选择和限额透明化,实用性会更高。

AI HOT 精选

Anthropic 研究所公布四个核心研究方向,计划发布更细颗粒度的经济指数

Anthropic 新成立的研究所(TAI)把研究分成四块:AI 在经济里怎么扩散、新安全威胁和抗风险能力、真实世界里的 AI 系统、以及 AI 反过来加速 AI 研发。他们打算把 Anthropic 经济指数的数据发得更密、更细,用来当劳动力市场变化的早期预警。文章还提到,内部已经看到软件工程这类工作在快速改变,公司自己的运转方式也在变。这些研究成果...

推荐理由:这是一份研究议程,不是模型发布或产品更新,所以重要性不会冲太高。我会先打个折,把它放在74分。真正值得盯的不是这4个方向本身——经济扩散、威胁与韧性、真实世界AI系统、AI驱动研发——而是Anthropic明说这些研究结果会进入长期利益信托的决策链。也就是说,这不是写写白皮书,而是可能影响公司实际资源怎么分。正文还提到会发布更细粒度的Anthropic经济指数,用来追踪AI对就业和经济的实际影响,这点比泛泛而谈的“研究”要实在。不过正文没披露具体时间表,也没说信托的决策机制长什么样,所以别太激动,先当信号看。

Latent Space

Anthropic 租下 xAI 孟菲斯超算,年费或达 50 亿美元,Claude 推理能力几天内就要搬上去

Anthropic 在第二届开发者活动上宣布,将租用 xAI 在孟菲斯的 Colossus I 超算集群来跑 Claude 的推理任务,预计几天内就开始迁移。外界根据 300 兆瓦的功耗规模估算,这笔交易一年可能花掉 Anthropic 约 50 亿美元,相当于 xAI 变相成了一家提供算力租赁的云厂商。活动上没有发新模型,主要更新了三件事:一是 Cl...

推荐理由:这条消息最炸的点是 Anthropic 可能要从 SpaceX/xAI 租 300MW 算力,一年砸 50 亿美元——不过正文也说了这俩数字还不是官方口径,先打个折看。对开发者更实在的是 Claude Code 的 5 小时限额翻倍了,Pro、Max、Team 和席位制 Enterprise 都受益,Opus API 限额也往上调了,用起来没那么容易撞墙。整篇信息量够,既有大 deal 的传闻钩子,又有马上能用的产品变动,所以放在 featured 档。

新智元 · 公众号

Claude 托管智能体新增“做梦”功能,Harvey 实测任务完成率暴涨约 6 倍

Anthropic 给 Claude 的托管智能体加了三个新能力:Dreaming(做梦)、Outcomes(结果校验)和多智能体协作。其中“做梦”是指让 Claude 在后台读取最多 100 段历史会话,自己总结规则来改进表现,一次演示里它把 530 万 token 的对话提炼成了 98 条规则。法律 AI 公司 Harvey 实测后,任务完成率比之...

推荐理由:Anthropic 给 Claude 托管 Agent 加了三个东西:Dreaming 让模型事后翻历史会话自己总结规则,Outcomes 用偏好样本教模型对齐目标,多 Agent 编排让多个 Claude 协作干活。Harvey 说任务完成率大约翻了 6 倍,Outcomes 内部测试最高能提 10 个百分点。运行时另收 0.08 美元/会话小时,正文没披露这个定价的横向对比。我会先打个折:6 倍是合作方数据,没看到独立复现,但 Dreaming 从 530 万 token 压到 98 条规则这个例子确实说明能省不少上下文成本。

彭博科技

Kimi 开发商月之暗面完成美团领投的新一轮融资,估值冲到 200 亿美元

月之暗面(Moonshot AI)又拿钱了,这次大约融了 20 亿美元,估值直接拉到 200 亿美元。标题说美团是领投方,但正文没披露具体投资人名单、各自投了多少、出让了多少股份,也没说钱打算怎么花。这个估值信号很直接——市场对中国 AI 创业公司的胃口还很大,但信息缺口也不小,先别急着下结论。

推荐理由:Bloomberg 的消息,Moonshot AI 拿了约 20 亿美元,估值干到 200 亿,标题说美团领投。我会先打个折:正文没写美团之外还有谁、股权怎么分、资金用途也没提,所以这轮到底多“美团”还看不清。但不管怎样,这个估值数字本身就说明资本还在往头部模型公司猛灌,对国内 AI 圈的资金流向和算力竞争是个明确注脚。

AI HOT 精选

Amp 发布 Neo CLI,编程助手开始往“长链路、少盯屏”方向走

Amp 推出了新的命令行工具 Neo,核心变化是让编程助手从“人在旁边盯着”变成“扔给它自己跑”。Neo 支持远程控制本地线程、自动压缩上下文(不用再手动清理对话历史),并开放了 Plugin API 来扩展工具和交互方式。安全策略做了个大反转:默认允许所有操作,把安全把关交给插件系统。官方说 CPU 和内存占用也降了不少,但正文没给出具体版本号、价格...

推荐理由:Neo 把本地线程交给远程控制,默认允许所有操作,安全控制转嫁到插件系统,这个权限反转比功能更新本身更值得盯。远程编排和自动上下文压缩让 agent 能跑长链路任务,Plugin API 给了扩展空间,但正文没披露版本号、价格和性能降幅,实际省不省钱、稳不稳定还得等实测。Amp 的行业存在感加上信息缺口,把这条卡在 72–77 分区间,我会先打个折,别当成熟产品看。

机器之心 · 公众号

TACO 让命令行 Agent 自己学会扔掉没用的上下文

TACO 是一套不用额外训练的命令行输出压缩方法,让模型在执行任务时自己发现哪些终端回显是废话、哪些必须保留。它在 TerminalBench 1.0 和 2.0 上同时提升了任务成功率和 token 利用率,并发现 TerminalBench 2.0 的原始提示里有 24.6% 到 44.1% 的低价值冗余。核心机制是“任务内进化规则 + 全局规则池...

推荐理由:这篇论文解决的是终端 agent 上下文越跑越臃肿的老问题,方法很轻量——任务里生成纠偏规则,再存进全局规则池复用。TerminalBench 上的成功率提升和 token 效率改善都有数据支撑,24.6%–44.1% 的冗余比例和 >90% 的规则留存率是两个值得盯的指标。没有新模型或产品发布,属于扎实的 agent 工程研究,放在 featured 档合适。

机器之心 · 公众号

SWE-Bench 作者出新基准 ProgramBench,Claude、GPT、Gemini 全拿零蛋

这个新基准让模型从零复刻完整软件项目,只给可执行文件和说明文档,不给源码和测试。评测不看单函数写得对不对,而是用模糊测试跑行为一致性,看整个系统能不能用。结果 Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro 全部零完成率,一个都没跑通。这说明现在的模型离独立做系统工程还差得远,之前靠刷单函数题拿高分那套在这不管用。

推荐理由:我会先打个折:这只是单个基准测试报告,不是模型或产品发布。但 0% 的完成率太刺眼,而且测试设计很刁——只给可执行文件和说明文档,让模型从零重建项目,再用行为等价和 agent-driven fuzzing 判分。正文没披露样本量和任务难度分布,这点先别太激动。真正值得盯的是它把评测从函数级代码生成拉到了系统级工程能力,这对做 coding agent 的团队是个实打实的压力测试。

AI HOT 精选

Open Slide 用 React 写 PPT,让 AI 直接生成和修改幻灯片代码

Open Slide 是一个开源项目,把 PPT 当成 React 组件来写,工作流专门为 AI agent 设计。它用 React 组件库做扩展,方便接入各种图表。项目自带可视化编辑器,你可以手动改,AI 也能直接读你的批注来协同修改内容。它还集成了 SVGL 库,里面有 1500 多个品牌 Logo,做技术演示时直接拖就行。整体思路是让 AI 进到...

推荐理由:我会先打个折:正文没给出实际使用数据或上手测试,所以效果到底怎么样还不好说。但“PPT 变成可编程界面”这个思路本身值得关注,它把幻灯片从拖拽排版变成了代码生成,AI 能直接参与修改和迭代。1500+ Logo 库和评论驱动改稿这两个点让产品有了具体抓手,不只是又一个套壳工具。对经常做演示文档的人来说,省掉排版和反复调整的时间是实打实的价值。

Computing Life · Share · 鸭哥调研

Agent 文件系统:从“喂给模型记忆”到“让模型自己翻文件”

这篇文章梳理了 AI agent 外置记忆方案的三代演化:从把所有东西塞进上下文窗口,到用向量数据库做外挂记忆,再到 2025 年下半年兴起的“把文件系统当上下文用”。核心转变是让 agent 自己按需去文件系统里找信息,而不是开发者预先推送。文章解释了为什么这个模式现在成立:模型天生会操作文件系统、上下文窗口的成本已经高到不可忽视、渐进式披露能利用模...

推荐理由:这是一篇设计评论,不是产品发布或论文。它把 Agent 文件系统拆成三代,对比了 Turso、Anthropic、Vercel 和 Manus 的不同判断,还点出四个盲区,对做 Agent 的人有参考价值。信息量和相关性都够,但性质偏评论,所以放在 featured 而不是更高一档。

The Verge · AI

谷歌关停网页任务实验 Project Mariner,技术已并入 Gemini Agent

谷歌在 2026 年 5 月 4 日关掉了 Project Mariner,一个能让 AI 在浏览器里自动完成多步骤网页任务的实验项目。它之前最多支持同时跑 10 个任务。关停不是因为技术失败,而是这套能力已经挪到了谷歌正式产品里,比如 Gemini Agent 和 AI Mode。正文没披露具体迁移时间点和用户数据,所以实际落地效果还得看后续产品表现。

推荐理由:HKR 三项都过,但正文能拿到的硬信息就三块:关停时间、最多 10 个并发任务、技术并入了 Gemini Agent。Google 官方信源够硬,所以给 featured 低档,不是重大发布。

彭博科技

Scale AI 拿到五角大楼 5 亿美元合同,帮军方筛数据、辅助决策

五角大楼给了 Scale AI 一份 5 亿美元的合同,让他们做数据筛选和决策支持。文章提到 Meta 是 Scale AI 的投资方,但没披露合同期限、具体部署范围、用的是什么模型。这笔钱本身是个信号:美军开始在数据工作流上砸大钱,而不只是买硬件或武器系统。

推荐理由:HKR 三项都过,靠的是 5 亿美元军方合同和国防 AI 采购这个点。正文没披露合同期限、部署范围和模型细节,所以分数卡在 72–77 的 featured 区间。我会先打个折:钱数够大,但信息缺口也大,别急着脑补成完整武器系统。

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

5月6日星期三

r/LocalLLaMA

CopilotKit:一套 MIT 开源的 React 组件,帮你给 AI 应用搭聊天界面和生成式 UI

CopilotKit 是一套 MIT 协议开源的 React 组件库,专门用来给 agent 类应用搭前端。它把聊天、流式输出、工具调用、人机协同(HITL)和生成式 UI 这些常见需求都做成了现成的积木块。项目在 GitHub 上有 3 万颗星。它支持 AG-UI 协议,可以对接 LangGraph、CrewAI、LlamaIndex 等后端框架,核...

推荐理由:HKR 三项都踩中了:MIT 开源、3 万星、AG-UI 把 UI 和后端解耦,对做 Agent 产品的人是个实在的钩子。分数压在 74 没往上拉,因为正文没给新版本号、没跑分、也没点名哪个生产环境在用,信息量就到这儿。

TechCrunch · AI

苹果花 2.5 亿美元和解 Siri AI 功能跳票的集体诉讼

苹果同意支付 2.5 亿美元,和解一场关于 Siri 人工智能功能宣传的集体诉讼。诉讼指控苹果在 iPhone 16 发布前过度承诺了 Siri 的 AI 能力,但实际功能迟迟没上线。这笔钱怎么分、涉及多少用户,报道里都没提。

推荐理由:Apple 掏 2.5 亿美元和解 Siri AI 功能延期的集体诉讼,这个数字本身就说明问题不小。诉讼核心是说它过度承诺功能上线时间,但正文没写涉案用户数、赔付规则和功能时间表,所以具体影响范围还不清楚。对 AI 从业者来说,这比技术论文更值得看——产品宣传时话说太满,最后可能真得付钱。

r/LocalLLaMA

一个用公司内部数据测 RAG 的开放基准,模拟了 9 种数据源和 10 类检索失败模式

EnterpriseRAG-Bench 放出了一个 50 万文档的语料库,专门用来测 RAG 在公司内部数据上的表现。它模拟了 Redwood Inference 的 9 种数据源,并围绕 10 种检索失败模式设计了 500 个问题。基线测试显示,BM25 在整体上优于向量检索,而基于 agent/bash 的检索方式虽然完整度最高,但成本和延迟也明显更高。

推荐理由:HKR 三项都站得住:基准瞄准了企业 RAG 的真实痛点,50 万文档加上 BM25 反直觉的结果有话题性。不过来源只有一篇 Reddit 发布帖,信息密度还不到当天必写的程度,所以放在 featured 里。

Latent Space

硅谷开始认真卖服务了:Anthropic 和 OpenAI 各自成立公司,帮企业把模型塞进业务里

Anthropic 和 OpenAI 这周都宣布了新的企业服务公司。Anthropic 跟黑石等几家华尔街机构搞了个合资公司,总共融了 15 亿美元,每家出 3 亿。他们的做法是先派个小团队去客户那,搞清楚 Claude 能在哪发挥最大作用,然后工程师再上手定制系统。OpenAI 那边动作更大,成立了一家叫 The Deployment Company...

推荐理由:两家头部模型公司不约而同从卖模型转向亲自下场做服务,Anthropic 的合资公司拿了 15 亿美元,OpenAI 的部署公司融了约 40 亿、投前估值 100 亿。我会先打个折,正文没披露这些服务公司的具体业务模式、客户是谁、怎么收费,也没说跟现有云厂商的合作关系怎么处理。但光看资金规模和两家同时行动,这个信号够强,值得从业者留意。

机器之心 · 公众号

DeepSeek版Claude Code登顶GitHub热榜,8700星,一个叫鲸鱼哥的开发者用Rust做了个终端工具

这个叫DeepSeek TUI的工具在GitHub上拿了8700多颗星,是开发者Hunter Bown(鲸鱼哥)用Rust写的,让你在本地终端里直接调用DeepSeek V4干活。它能聊天、改文件、跑shell命令、管任务。比较特别的是RLM模式:一次可以派发最多16个V4 Flash子任务,上下文窗口有100万token,操作前还有审批关卡,等于让模...

推荐理由:我会先打个折:这是个人项目,不是 DeepSeek 官方出品,稳定性和后续维护都还是未知数。但 8700 星的热度是实打实的,RLM 的并发和审批设计也给了具体的技术细节,不是空炒概念。对想省钱又想在终端里用 DeepSeek 干活的开发者来说,这东西值得盯一下,但暂时别把它当生产工具。

机器之心 · 公众号

明略开源两套工具,让 Mac 跑本地模型和操控桌面

明略科技放出了两个开源项目:Cider 和 Mano-P 1.0,都是给苹果 M 系列芯片用的。Cider 是个推理加速引擎,在 M5 Pro 上跑 Qwen3-VL-2B 时,把生成第一个 token 前的等待时间缩短了 57% 到 61%。Mano-P 1.0 是个能操作电脑界面的模型,72B 版本在 OSWorld 测试里拿了 58.2 分。不过...

推荐理由:我会先打个折:明略不是一线模型实验室,所以分数没往上拉。但选题本身够实用——Mac 本地跑视觉模型和 GUI 智能体,还给了可复现的提速数据和内存门槛。Cider 的 prefill 加速和 Mano-P 在 OSWorld 的成功率都有具体数字,16GB 设备准确率下降也写明了,不是纯 PR 稿。对想在 Apple Silicon 上折腾本地推理的人,这篇值得看一眼。