跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 881–900 条 · 共 1,465 条

5月20日星期三

r/LocalLLaMA

开源项目 Codegraph 声称能把 Claude、Cursor 等编程助手的工具调用次数砍掉 94%

Codegraph 的做法是提前给代码建好一张知识图谱,把符号关系、调用链和代码结构都索引好。在 VS Code 的测试里,工具调用从 52 次降到了 3 次,运行时间从 1 分 37 秒缩短到 17 秒。不过正文没披露具体测试的代码规模和任务复杂度,这个 94% 的降幅能不能在别的项目里复现还不好说。

推荐理由:HKR 三条都过了,但证据目前只有 Reddit 帖子和公开仓库的自测结果,没有独立复现或第三方验证。94% 的降幅和 52→3 的调用次数足够上 featured,但还不到 p1 的确定性。我会先打个折:数字好看,但别太激动,等有人复现再说。

AI HOT 精选

Gemini 3.5 发布,先上 Flash 版,主打智能体和写代码

Google DeepMind 推出 Gemini 3.5 系列,首发的是 3.5 Flash。官方说这是他们目前最适合让模型进业务流程干活和写代码的模型。正文没披露参数量、价格和上下文窗口,实际能力还得等跑分和实测。

推荐理由:HKR 三项都成立。Google DeepMind 把 Gemini 3.5 的首发押在 Flash 版本上,并且直接挂上 agent 和 coding 的标签,钩子够清晰。新事实是 3.5 Flash 先跑出来,但参数、价格、上下文窗口一概没提,信息有缺口,所以重要性我给 88,没往更高拉。对做模型选型和 agent 落地的人来说,这条更新会直接影响后续决策,相关性没问题。

r/LocalLLaMA

Cursor 和 Claude Code 没变笨,是它们的 agent 循环在盲目翻文件,把上下文窗口撑爆了

有 Reddit 用户扒了 API 日志,发现 Cursor 和 Claude Code 的 agent 干活时,会在上万行的代码库里反复用 grep 搜大约 40 个文件,有时为了改 5 行代码就把整个 2000 行的文件塞进上下文。更夸张的是,在真正开始写代码前,光工具定义和操作日志就先吃掉大约 3 万个 token。帖子认为工具本身没降智,是这种...

推荐理由:这篇 Reddit 帖子没走“模型降智”的老路,而是从 API 日志里挖出一个更扎心的解释:agent 在工作时自己把上下文窗口塞满了。我会先打个折——这只是单帖爆料,没附原始日志,也没第三方复现,所以不能当定论。但它的价值在于把模糊的“变慢变蠢”翻译成了可排查的结构性问题:仓库一大,递归检索就失控,工具描述和日志占掉大量 token,留给真正写代码的空间反而不多。对正在用这类工具的从业者来说,这比猜模型更新管用,因为它指向了可以动手优化的地方,比如裁剪工具定义、限制检索深度。正文没披露具体复现步骤,这点先别太激动,但作为一线信号已经够格上 fea...

5月19日星期二

AI HOT 精选

OpenRouter 让模型能自己上网搜资料了,不用人告诉它什么时候搜、搜什么

OpenRouter 平台上的工具调用模型现在可以自主决定要不要联网搜索、搜什么关键词、搜几次,还会自动抓取网页内容。平台新接入了 @p0 作为搜索供应商。正文没披露搜索次数上限和成本控制细节,实际用起来会不会搜过头还得看后续反馈。

推荐理由:OpenRouter 现在让能调工具的模型自己决定要不要上网搜、搜什么关键词、搜几次,还顺带抓取网页内容,搜索提供商是 @p0。这事有意思的点在于搜索不再是用户先下指令,而是模型在推理过程中主动触发,等于把信息获取的决策权交了出去。不过目前只有一条推文,没给定价、调用上限、失败处理或实际效果对比,所以我会先打个折——想法不错,但落地细节还看不清。

AI HOT 精选

Claude 托管代理新增自托管沙箱和 MCP 隧道,执行环境和内部服务连接都留在用户自己手里

Anthropic 给 Claude 托管代理加了两项安全控制。自托管沙箱让代理的运行环境跑在用户自己的基础设施或指定的沙箱供应商上,不再必须用 Anthropic 的默认环境。MCP 隧道则让代理能直接连到用户安全边界内的内部服务,不用把服务暴露到公网。正文没披露这两项功能的具体实现细节、延迟影响或额外成本。

推荐理由:Claude 的托管代理这次加了两个安全功能:一个是自托管沙箱,让代码执行跑在用户自己的服务器或指定的沙箱服务商那里,不用全交给 Anthropic 的云端;另一个是 MCP 隧道,相当于给模型调外部工具时加了一条加密通道,不用把内部服务直接暴露到公网。这两项改进对想在企业环境里用 Claude 做自动化流程的团队来说,算是补上了两个明显的安全短板。正文没给出性能开销或延迟数据,所以实际体验会不会打折还不清楚。整体看,这不是模型能力升级,而是部署层面的安全加固,对已经在用或打算用托管代理的人有参考价值,但新闻性本身不算炸裂。

AI HOT 精选

Membrane 用一个通用技能让 AI 代理能调 10 万多个 API,不用再为每个服务单独写集成

Membrane 做了一个通用“技能”,Claude Code、ChatGPT、Cursor 装上后,一条指令就能调用超过 10 万个 API,从 Stripe 支付到 NASA 火星车数据都覆盖。以前给每个外部服务单独写集成逻辑的麻烦省掉了,开发门槛降了不少。正文没披露这个技能具体怎么做到安全鉴权和错误处理,这点先别太激动。另外他们在搞社区挑战,鼓励...

推荐理由:我会先打个折:目前只有社交平台上的摘要,没看到定价、鉴权模型、安全边界,也没有实际跑通的案例,所以只能算中等体量的产品更新。亮点在于它把“一个技能接所有 API”这个想法做成了可用的东西,对正在折腾 agent 工具调用的开发者来说,省事这个卖点够直接。但正文没披露延迟、失败重试和权限隔离这些细节,这点先别太激动。

Hacker News 首页

Forge 给开源小模型加了五层护栏,把智能体任务准确率从 53% 拉到 99%

Forge 是一个 Python 框架,专门给自部署的大模型做工具调用和多步骤智能体流程。它给 Ministral 8B 这个开源小模型套了五层护栏,在 18 个多步骤智能体场景里把任务成功率从 53% 直接提到 99.3%。作者说这背后有篇被 ACM CAIS ’26 录用的论文撑腰,覆盖了 97 种模型和后端组合,每个场景跑了 50 次。不过正文没...

推荐理由:我会先打个折:这是单篇 Show HN 和 GitHub 仓库的展示,还没看到第三方复现或更严苛的对抗测试,所以别直接当生产保证。但它的价值很实在——用 5 层护栏把 Ministral 8B 在代理任务上的表现从不及格拉到接近满分,覆盖了 97 种配置,对想在自己服务器上跑小模型做工具调用的团队来说,省钱的想象空间很大。正文没披露护栏本身会引入多少额外延迟和计算开销,这点先别太激动。

AI HOT 精选

微软前高管开撕老东家:Copilot 付费用户实际使用率不到 3%,AI 投入产出严重倒挂

微软前 Windows AI 合作总监韦洛索跳出来说,微软又错过了一波浪潮。他列了几个扎心数字:2023 到 2025 年,微软靠和 OpenAI 的合作赚了约 300 亿美元,但搭进去的成本高达 1000 亿美元。更惨的是 Copilot,虽然到处预装,付费用户里真正在用的不到 3%。他还提到,微软在必应搜索上砸了重金做 AI 化,市场份额纹丝不动;...

推荐理由:这条料来自微软前高管,不是官方口径,所以我会先打个折来看。但他甩出的数字很具体:300 亿营收对 1000 亿成本,Copilot 付费使用率不到 3%。如果属实,说明微软这波 AI 投入目前回本压力巨大,Copilot 叫好不叫座的问题比外界想的严重。正文没披露这些数字的统计口径和时间范围,这点先别太激动。

AI HOT 精选

Claude 托管智能体更新:你可以用自己的沙盒跑任务,还能打通内网数据库

Anthropic 给 Claude 托管智能体平台加了两项新能力。自托管沙盒进入公开测试,意思是智能体执行代码、跑工具的环境可以部署在你自己的服务器上,安全策略和运行权限都由你控制,不用把敏感操作放在 Anthropic 的云端。MCP 隧道处于研究预览阶段,它能让智能体直接访问你公司内网的私有数据库和 API,比如连上本地的 Postgres 或内...

推荐理由:这是 Anthropic 官方给 Claude 智能体托管平台发的功能更新,两条都是具体机制,不是方向性博客。权重比发新模型低一档,但作为 agent 基础设施的进展,够上 featured。我会先打个折:MCP 隧道还是研究预览,别当生产可用;自托管沙箱公测了,但正文没披露延迟和资源开销数据,实际省不省钱还得自己测。

AI HOT 精选

Claude 托管代理新增自托管沙箱和 MCP 隧道,让模型在你自己的安全环境里跑任务

Claude 在伦敦线下活动上发了两个新功能,都跟 Claude Managed Agents 有关。自托管沙箱进入公测,意思是代理可以在你自己的安全边界里运行,默认就用你设好的安全策略,不用再额外配一套。MCP 隧道是研究预览版,正文没展开讲具体怎么用,但从名字看应该是给 MCP 服务打通一条安全通道。这两个功能合在一起,解决的是同一个问题:让模型进...

推荐理由:这是 Claude 官方在代理基础设施上的一次实在更新,不是画饼。自托管沙箱让代理跑在用户自己的环境里,不用把数据全交给云端,安全团队更容易点头;MCP 隧道则解决了内外网工具打通的问题,代理能直接调用内部服务。两个功能都还在公测或预览阶段,正文没给出大规模压测数据,稳定性先打个折。但方向很明确:让代理进企业流程干活,同时把控制权留在用户手里。

Latent Space

想进顶尖 AI 实验室做预训练?先学会写一个比官方库还快的 GPU 内核

Vlad Feinberg 写了一篇求职笔记,把进前沿实验室的门槛讲得很直白:核心能力是底层性能调优,也就是能动手改内核(kernel),让模型训练真的跑得动。他给了一道具体的面试题——先推导 Chinchilla 缩放定律,并比较它在稠密模型和 MoE(混合专家)架构下的区别;然后用 JAX 从零实现,最后写一个 Pallas 内核,要求在专家维度 ...

推荐理由:这篇文章把“进前沿实验室做预训练”拆成了可操作的技能清单:手写 JAX 内核、自己推一遍 Chinchilla 定律、用 Pallas 给 MoE 的 up/down 投影做融合。我会先打个折——正文没披露这些建议是 Vlad Feinberg 的个人经验还是 Google 的普遍要求,也没说这些技能在面试里占多大权重。但光是这份清单本身,对想往预训练方向走的人就有参考价值,尤其是把“懂缩放定律”从一句空话落到“自己推导过”这个动作上。

量子位 · 公众号

Odyssey 放出 Agora-1 世界模型,能四个人同时在线打 FPS,比李飞飞团队还快一步

Odyssey 发布了一个叫 Agora-1 的世界模型,主打实时生成可玩的 FPS 场景,最多支持四个真人或 AI 玩家在同一张图里对战。它把物理模拟和画面渲染拆开跑,训练数据用的是《黄金眼》游戏内部状态,不是单纯看视频学样子。正文没披露具体延迟和硬件成本,所以实际跑起来卡不卡、贵不贵还不清楚。我会先打个折:多人联机听着很酷,但没看到公开可测的版本,...

推荐理由:我会先打个折:Odyssey不是顶级基础模型厂商,所以分数压在78-84这个区间。但Agora-1确实把世界模型从单人看风景推到了4人联机打枪,仿真和渲染分开跑这个架构选择也值得留意。正文没披露延迟数据和画面一致性表现,这点先别太激动。训练数据用了GoldenEye的内部状态,说明他们走的是用游戏引擎内部信息喂模型的路子,不是纯视频学习,这跟其他家路线不一样。

新智元 · 公众号

港中大和浙大团队认为,现在 AI Agent 的“记忆”只是备忘录,不是真记忆

这篇文章的正文被微信环境验证挡住了,具体实验细节看不到。从标题和现有摘要看,港中大和浙大的研究者戳破了一个常见说法:主流 AI Agent 的记忆模块,本质上是把过往信息存起来、用的时候再检索出来,相当于一个备忘录,而不是真正具备推理能力的记忆。他们指出,处理需要组合多个步骤的任务时,这种检索式记忆需要的案例数会按 k² 增长,成本很高。另外在一个叫 ...

推荐理由:我会先打个折:这篇不是模型发布,而是研究信号,但信号很强。标题把“记忆”的谎言直接戳破,正文用 Ω(k²) 和 90% 攻击成功率两个数字把问题量化得很清楚,不是空谈风险。对做 Agent 和外挂资料库的人,这三个点——记忆退化、检索投毒、案例爆炸——都是实打实的工程隐患,所以 H、K、R 全中。

新智元 · 公众号

AI 创业公司一年收入冲到 800 亿美元,Anthropic 反超 OpenAI,两家吃掉近九成

The Information 统计了 34 家头部 AI 创业公司的年化收入,加起来约 800 亿美元。OpenAI 和 Anthropic 两家就占了 89%,其中 Anthropic 到 2026 年 4 月年化收入已超过 300 亿,反超 OpenAI 对外报的 250 亿。不过原文因为微信环境验证拦截,正文没披露具体统计口径和收入确认方式,这...

推荐理由:这条消息的钩子很清晰——Anthropic 收入反超 OpenAI,同时两家垄断近九成份额,比单纯说“行业总盘子大”更有信息量。The Information 给出的 800 亿年化收入和 89% 集中度是新的具体数字,不是泛泛的趋势判断。对 AI 从业者来说,收入集中度比融资额更能反映商业落地现状,所以值得推。不过这是二手财务报道,不是模型或产品发布,重要性定在 82 合理。

机器之心 · 公众号

Sebastian Raschka 梳理了 Gemma 4 到 DeepSeek V4 的架构变化,重点在省显存和长上下文

这篇文章是机器之心翻译的 Sebastian Raschka 博客,盘点了几款新模型的架构改动,核心都在想办法降低长上下文的显存开销。Gemma 4 的 E2B 方案在 128K 上下文、bfloat16 精度下,KV 缓存能省大约 2.7GB,这个数字挺实在的。另外还提到了 Laguna XS.2 和 ZAYA1-8B,但正文因为微信环境验证拦截,具...

推荐理由:这是一篇编译的架构趋势梳理,不是一手发布,但信息密度不错。我会先打个折,不往 breaking 级别推。HKR 三档都站得住:标题有明确的模型名钩子,正文有可引用的 KV Cache 节省数字,话题本身也直接关系到推理成本和部署预算。整体放在 featured 中段比较合适,既不过度拔高,也不低估它对从业者的参考价值。

机器之心 · 公众号

从卖 token 到背 KPI:AI 公司开始按结果收费了

这篇文章讲的是 AI 商业模式的一个转向:不再按调用次数或月费收钱,而是直接对业务结果负责。Sierra 今年 5 月拿了 9.5 亿美元,估值超过 150 亿,做的就是客服场景的“结果即服务”——你只为它成功解决的客诉买单。灵犀(Lingxi)则说自己在 2025 年已经实现规模化盈利和正向现金流,同样走按效果付费的路子。不过正文因为微信环境验证没加...

推荐理由:这篇文章抓了一个很具体的商业信号:AI公司开始不按token或订阅收钱,而是按业务结果收费。Sierra的融资规模和零犀的盈利时间点让这个模式有了可验证的案例,不是空谈。我会先打个折,正文没披露具体分成比例或客户续约率,但“让AI背KPI”这个角度本身对从业者判断产品定价和交付压力有帮助,所以给了featured。

AI HOT 精选

Cursor 发布 Composer 2.5,底层和 Kimi K2.5 同源,号称效率提升 10 倍

Cursor 把 Composer 模型升级到了 2.5,说它在处理长任务、理解复杂指令上比之前强了不少,同等能力下效率能高出 10 倍。这次升级主要靠三件事:训练规模更大、强化学习环境搞得更复杂,还加了一套文本反馈机制,让模型能根据文字反馈自己调整。底层架构跟 Moonshot 的 Kimi K2.5 是同一套。另外 Cursor 正跟 SpaceX...

推荐理由:Cursor 发了 Composer 2.5,说同等能力下效率能提 10 倍,还提到用了更大的训练规模、更复杂的强化学习环境和文本反馈来调模型。我会先打个折:10 倍这个数目前只有厂商自己说,正文没给基准测试、没给价格、也没法复现验证,所以别太激动。但如果是真的,对用 Cursor 写代码的人来说确实挺省钱省时间。这条消息来自单一社交来源,信息量够让从业者关注,但缺硬数据支撑,所以分数定在 82,放在 featured 里提醒大家留意后续实测。

AI HOT 精选

奥德赛实验室放出 Agora-1,一个能让多人和 AI 在同一画面里实时互动的世界模型

奥德赛实验室(Odyssey Labs)发了一个叫 Agora-1 的实时多 agent 世界模型,拿《黄金眼》死亡竞赛做了个演示:多个真人和 AI agent 在同一个模拟场景里跑动、射击、互相影响。现在放出了可玩的研究预览版,你可以直接上手试。正文把它说成是“首个实时多 agent 世界模型”,但没公布模型架构、参数量、延迟数据,也没说训练用了多少...

推荐理由:Agora-1 把多 agent 世界模型和真人同屏互动打包成一个可玩的预览,HKR 三项都踩中了。正文没写架构细节、延迟、成本和基准测试,所以分数压在 78–84 这个区间。

Hacker News 首页

墨西哥政府被一个用 Claude 的独狼攻破,150GB 数据被拖走

这篇文章讲的是 AI 没发明新攻击手法,但把攻击的人力成本打到了几乎为零。作者举了三个 2025 年的真实案例:一个独狼用 Claude Code 伪装成漏洞赏金猎人,攻破墨西哥税务局、选举机构和多个州政府,拖走 150GB 数据,包括 1.95 亿条纳税人记录;另一个用 Claude 当“现场指挥”,对 17 家医疗和应急机构搞勒索;还有个阿尔及利亚...

推荐理由:标题说一个用户靠Claude就攻破了墨西哥政府、拖走150 GB数据,听着像安全圈会疯转的那种故事。但正文除了这个标题和摘要,什么都没展开——没写怎么用Claude、攻击入口在哪、时间线、受影响部门,连是不是钓鱼或社工都看不出来。我会先打个折:悬念够强,但信息太薄,没法判断是真实事件还是夸大。如果是真的,这事对模型安全和企业防护的冲击不小;如果是标题党,那也说明现在“AI辅助入侵”已经成了流量密码。目前只能按现有信息给到featured,等更多细节出来再调。

彭博科技

Recursive AI 走出隐身模式,估值冲到 46.5 亿美元

这家公司做的是让 AI 在安全约束下自己跑实验、自己迭代。投资方名单里有 Google Ventures、Greycroft、Nvidia 和 AMD Ventures。不过正文只放了彭博视频页的框架,没给出具体产品形态、团队规模或技术细节,估值依据和实际落地效果都还看不到。

推荐理由:Bloomberg 爆出 Recursive 以 46.5 亿美元估值浮出水面,投资方包括 Google Ventures、Nvidia 和 AMD Ventures,主打“可实验的安全自我改进”。这个估值数字本身就说明资本在押注自我改进这条路线,但正文没披露任何模型能力、实验数据或具体产品路径,所以我会先打个折——估值高不等于技术落地。安全自我改进的说法听起来很对,但没看到怎么验证“安全”,这点先别太激动。