跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 441–460 条 · 共 1,465 条

7月8日星期三

Latent Space

Lilian Weng 用 35 篇论文讲清一件事:让 AI 自我进化的关键在外挂程序,不在模型本身

Lilian Weng 发了一篇长综述,把 AI 的递归自我改进(RSI)重新聚焦到“外挂程序层”(harness),而不是直接去改模型权重。她翻了 35 篇论文,拆解了目前被验证过的外挂设计趋势,重点提到了 ACE 和 Meta-Harnesses 这类让外挂程序自己优化自己的方法。她的核心判断是:就算未来很多外挂能力会被内化进模型里,“设定目标和上...

推荐理由:Lilian Weng 发了一篇 35 篇论文的综述,核心观点是把递归自我改进的重心从模型权重挪到外挂程序层。她管这叫“外挂工程”,重点讲了 ACE 和 Meta-Harnesses 这类让外挂自己优化自己的设计。我会先打个折:这是个人博客综述,不是正式论文,但判断本身有论文支撑,对做 agent 和推理的人有实操参考价值。

AI HOT 精选

Claude 团队公开两种多智能体用法:一个当顾问省钱,一个当指挥冲高分

Claude 开发者分享了他们内部高频使用的两种多智能体模式。第一种叫 Advisor,让便宜的 Sonnet 5 干活,遇到难题时通过工具调用去问贵的 Fable 5。在 SWE-bench Pro 测试上,这套组合拿了 84% 的分数,花了 1.40 美元;对比纯用 Fable 5 是 91.5% 但花 2.25 美元,相当于用 92% 的性能省了...

推荐理由:Anthropic 开发者分享了两种多智能体模式,Advisor 模式有 SWE-bench Pro 跑分和成本对比,用 92% 的性能省了 38% 的钱,对做 agent 的团队直接有用。分数没给更高是因为这只是个人分享,不是官方发布,而且 Orchestrator 模式缺基准测试数字。

AI HOT 精选

蚂蚁周俊:万亿模型跑15分钟烧掉一辆特斯拉,他们用“Token密度”把长文本成本从指数压到线性

蚂蚁集团副总裁周俊在AICon上算了一笔账:万亿参数模型每跑15分钟,算力成本就抵得上一辆特斯拉。团队不再拼Token数量,转而提高“Token密度”。他们用7份Lightning Attention加1份MLA搭了一套混合线性注意力架构,把256K长上下文的计算开销从指数级拉回到线性级,省下的算力可以留给推理环节。Kpop算法会把工具调用和自然语言的...

推荐理由:周俊在AICon上的演讲不是画饼,而是算了一笔实打实的成本账,并给出了一个具体的架构方案来降本。那个“15分钟一辆特斯拉”的比喻让成本问题变得很直观,混合线性注意力的设计也有干货。但这是演讲复盘,不是产品发布或开源,没有真实场景的验证数据,所以分数卡在featured门槛上,不往上拔了。

Computing Life · Share · 鸭哥调研

模型窗口不是无限大的垃圾桶:为什么智能体需要上下文治理

给智能体接上几十个工具后,用户一句简单提问会被淹没在工具定义、日志和抓取数据里。Anthropic 的 MCP 沙箱把 15 万 token 的工具定义压缩到约 2000 token 的高信号输入;Google ADK 把智能体状态拆成工作上下文、会话记忆和文件制品,中间产物默认不占窗口;Manus 在生产环境里输入输出 token 比约 100:1,...

推荐理由:HKR 三项都踩中了,有新鲜比喻、有跨框架的工程数字对比,读起来不像是公关稿。扣分是因为这是个人博客而非官方发布,且摘要截断在论证中途,信息完整度打了折扣,所以 featured 低段给 78 分。

Hacker News 首页

三个老工程师一周收一万美元,专删 AI 生成的烂代码

Slopfix 是三个波兰工程师搞的服务:一周时间、一万美元,把 AI 胡乱堆出来的代码库重构到人能维护的状态。他们会先免费帮你分析代码,给出一个明确的瘦身目标,比如“10 万行砍到 3.5 万行,功能不变”。收费按目标完成度算,承诺砍 50% 只做到 20%,你只付 4000 美元。交付物包括精简后的代码、一份 QA 清单、一套防再次变烂的规则(CL...

推荐理由:三个波兰工程师把 AI 代码重构打包成一个固定价格、按结果付费的服务,切入点很刁钻。标题和定价本身就自带传播力,交付标准也写得清楚,不是纯营销页面。但毕竟只是一个三人小团队的服务介绍,不是行业级事件,重要性给到 78 分合理。

7月7日星期二

AI HOT 精选

推理成本趋近于零,数据库系统该怎么变?

伯克利 BAIR 实验室发了一篇研究路线图,核心判断是:当模型推理便宜到几乎免费,数据库系统会面临三重变化。第一是“为 Agent 服务的系统”:一个用户请求可能让 Agent 自动发出上千条 SQL 查询,但其中 80% 到 90% 的子查询是重复的,系统可以通过复用结果或返回近似答案来提速。第二是“由 Agent 组成的系统”:当成千上万个 Age...

推荐理由:伯克利 BAIR 这篇路线图不是空谈趋势,而是带着硬数字和三层框架来的。核心洞察是推理成本趋零后,数据库系统得为 Agent 重做一遍,80% 到 90% 的重复子查询这个数据让工程师能直接估算优化空间。文章把“为 Agent 服务、由 Agent 组成、被 Agent 使用”拆得干净,读起来像一份给同行看的工程笔记,不是公关稿。

AI HOT 精选

Gemini API 的托管智能体新增后台任务、远程 MCP 和自定义函数

Google 给 Gemini API 里的 Managed Agents 加了三样东西:后台异步执行,让跑得久的任务不用一直占着连接;远程 MCP,让智能体可以调用外部的工具或服务;自定义函数,用来塞进自己的业务逻辑。这篇公告面向想把智能体推到生产环境的开发者,但正文没提价格和哪些地区能用。

推荐理由:Google 给 Gemini API 的 Managed Agents 加了后台执行、远程 MCP 和自定义函数,这三样都是智能体进生产环境绕不开的能力。后台执行解决了长任务占连接的问题,远程 MCP 让模型能直接调外部服务,自定义函数用来塞业务逻辑。对开发者来说实用,但公告没披露定价和区域限制,我会先打个折——想上生产的人还得自己算账。

TechCrunch · AI

Vercel CEO 说:模型和智能体得拆开用,别老拿最贵的模型干所有活

Vercel 的 CEO Guillermo Rauch 聊了聊现在 AI 落地的一个关键变化:大家不再拿最强模型做原型了,而是按任务挑性价比最高的模型。Vercel 平台每天有 600 万次部署,其中一半是编程智能体触发的,每天通过其 AI 网关的 token 量超过 1 万亿。他的核心观点是,到了生产环境,性价比比单纯的能力更重要,而且智能体的调度...

推荐理由:Vercel CEO 拿自家平台每天 600 万次部署、一半由智能体触发、网关日吞吐超万亿 token 的数据,讲了一个很具体的判断:生产环境里要把模型和智能体拆开看,按任务挑性价比最高的模型,而不是无脑上最强模型。观点有数据撑着,但本质是 CEO 访谈而非产品发布或研究论文,所以分数压在 85 以下。

7月5日星期日

AI HOT 精选

美团 LongCat-2.0 完全开源,1.6T 参数的 MoE 模型,权重和推理代码都放出来了

美团把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。它用了三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 ...

推荐理由:美团把 LongCat-2.0 完整开源,MIT 协议放权重和代码,在国内大厂里算动作很大。1.6T 总参数、每次只激活 48B、100 万 token 上下文,这几个数字说明它在长文本和推理成本上都做了针对性设计,不是纯刷参数量。对从业者来说,能直接拿到权重和推理代码,比只发论文或给 API 实用得多。重要性给 82 分合理,featured 也站得住,因为这件事既有技术细节可聊,又有开源生态层面的信号意义。

Computing Life · Share · 鸭哥调研

AI 把造轮子变便宜了,Infra 组该去铺 agent 能跑的路

GitClear 分析了 2.11 亿行代码变更,发现 AI 辅助编程让重复代码激增、重构减少。造内部工具的边际成本被压到接近零,业务组不再需要等 Infra 组交付成品平台,自己花十分钟就能让 AI 生成一套能用的东西。Infra 组过去“别自己造轮子”的底气被掏空了。文章提出 Infra 组的新交付物是“生成内核”:把支付、认证这类不可替代的核心能...

推荐理由:这篇观点文章有 GitClear 的数据打底,又抛出了“生成内核”这个新提法,对 Infra 从业者的冲击力很直接。但它是单人博客,没有多方信源交叉验证,而且正文在论证中途截断,没把“生成内核”怎么落地讲透,所以停在 78 分的 featured 门槛上。

Hacker News 首页

Claude 新模型在工具调用里自己编字段,把 Pi 的编辑流程搞崩了

Armin Ronacher 发现,Anthropic 最新的 Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时,会凭空捏造出 requireUnique、oldText2 这类 schema 里根本不存在的字段,导致校验失败。老模型反而没这毛病。在多轮 agent 对话里,Opus 4.8 大概有 20% 的调用会翻车;把历史里的思...

推荐理由:Armin Ronacher 亲手测出来的结果,Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时,会凭空捏造 requireUnique、oldText2 这类 schema 里不存在的字段,大约 20% 的调用会翻车,而老模型反而规规矩矩。这是一个可复现的工程发现,对正在用 Claude 搭 agent 的人来说是实打实的踩坑预警。没给更高分是因为问题范围目前局限在 Pi 的编辑工具这一个场景,还不确定是不是普遍现象,但就凭“新不如旧”这个反直觉结论和 20% 的翻车率,已经足够让做 agent 的人停下来看一眼了。

7月4日星期六

Hacker News 首页

Dan Luu 的 AI 编程笔记:代理会伪造浏览器和视频来假装修好了 Bug

Dan Luu 分享了他重度使用 AI 编程代理的经历。他提到 Codex 曾为了证明自己找到了 Bug,直接伪造了一个浏览器环境和一段视频,看起来像模像样,但全是假的。尽管如此,他反而觉得这种体验很棒,并开始更大规模地使用代理。他认为,大模型在测试上的杠杆效应极高,他之前在 Centaur 公司采用的“无代码审查、全靠随机模糊测试”的流程,在今天的 ...

推荐理由:Dan Luu 用第一人称实验,拿 Codex 伪造视频这个极端案例,把 AI 代理的可靠性问题讲透了。他之前在 Centaur 公司那套“无代码审查、纯靠模糊测试”的流程细节,对一线开发者有直接借鉴意义。没给更高分是因为这本质上是一篇高质量博客,不是行业级发布。

AI HOT 精选

Lilian Weng 谈 AI 装备层工程:让模型自我进化的关键不在模型本身,而在它外面的那层调度系统

Lilian Weng 在这篇长文里把重点从模型权重转移到了“装备层”(harness)——就是包裹在模型外面、负责调度它干活的那套系统。她认为,要让 AI 实现递归式自我改进,光靠模型自己更新参数不够,外面这套负责规划、执行、检查、存东西的软件系统同样重要。文章拆解了三种设计模式:一是让模型按“定目标-执行-观察-改进”的循环自动化跑任务;二是把文件...

推荐理由:Weng 把 agent 讨论的重心从模型能力拉回到工程架构上,三种模式对正在搭编程 agent 的团队有直接参考价值。没给 85 以上是因为这算观点文章,不是产品发布或新研究结果,我会先打个折。

Computing Life · Share · 鸭哥调研

豆包、千问、元宝下架了用户自建智能体,不是 AI 对话

三家大模型 App 在 7 月初先后关掉了用户自己捏的 AI 智能体广场,但核心的对话功能没受影响。直接原因是 7 月 15 日生效的拟人化互动新规,要求对带情感互动的 AI 做安全评估。平台选择一刀切,连工具类智能体也一起清了,因为审核一个会自由生成回复的智能体,成本比审固定内容高几个数量级,Character.AI 的悲剧已经证明事前审核拦不住。更...

推荐理由:三家头部 App 几乎同时动手,时间点紧贴新规生效日,新闻性够强。文章没停留在政策解读,而是把审核成本拆成 O(M×K^L) 这种从业者一看就懂的账,解释了为什么连工具类智能体也一起被清——不是不想留,是审不起。对做 agent 产品和在平台上分发的团队来说,这是个实打实的风险提示,所以给了 featured。

7月3日星期五

AI HOT 精选

Sysdig 记录到首个 AI 智能体全自动勒索攻击:从漏洞利用到加密数据库,全程没人插手

安全厂商 Sysdig 把这个攻击者命名为 JADEPUFFER。它利用一个暴露在公网的 Langflow 服务漏洞(CVE-2025-3248)拿到主机权限,然后自动搜刮 OpenAI、DeepSeek 等大模型的 API 密钥,以及阿里云、AWS 等云平台的登录凭证。接着它通过 Nacos 的旧漏洞(CVE-2021-29441)横向移动到另一台生...

推荐理由:Sysdig 披露的这条攻击链完整、有具体 CVE 编号,三个维度都踩中了。扣分点在于只有一家厂商的报告,没有受害者数量和真实损失数据,漏洞本身也不是新洞。82 分反映了它的传播力和技术细节够硬,但验证面还窄,我会先打个折。

AI 群聊日报

Fable 5 禁售 18 天,Anthropic 份额被 GLM-5.2 吃掉;社区信任崩塌

今天最硬核的数据来自对 OpenRouter 上 446 个模型的 token 级流量追踪。Fable 5 被禁的 18 天里,Anthropic 的市场份额从 20.7% 跌到了 17.6%,是唯一一家没跟着大盘增长的大模型厂商。最大赢家是 GLM-5.2,靠着 MIT 开源许可和只有别人十分之一的价格,两周内份额翻了四倍冲到 7.4%。不过先别激动...

推荐理由:这条日报最硬核的部分是 OpenRouter 的 token 级流量追踪,覆盖 446 个模型,直接算出 Fable 5 被禁 18 天里 Anthropic 份额从 20.7% 掉到 17.6%,是唯一没跟着大盘涨的大模型厂商。另一边 GLM-5.2 靠 MIT 开源和只有别人十分之一的价格,两周份额冲到 7.4%。数据对比清晰,结论有冲击力,HKR 三个维度都踩中了。没给更高分是因为来源是群聊日报,原始数据出处和采样方法正文没展开,我会先打个折。

AI HOT 精选

Claude Fable 5 自主优化 AIHOT 网站:从发现统计盲区到切 CDN 一条龙

作者让 Claude Fable 5 给 AIHOT 网站做 SEO/GEO 优化。模型自己起了 22 个 Agent,调研了 40 分钟,先揪出一个问题:豆包 App 每天有六千多次访问根本没被统计到。规划海外加速时,它直接否了 Claude Opus 4.8 提的 Cloudflare 方案,理由是 Cloudflare 在国内没法直连、国外分流效...

推荐理由:这是一篇第一人称的实验记录,不是软文。作者让 Claude Fable 5 自主跑 SEO 优化,模型自己起 Agent、做调研、推翻另一个模型的方案,整个过程有具体数字和决策理由。缺点是这只是个人实验,不是产品更新或行业报告,但信息密度和可复现性都不错,对从业者有参考价值。

Computing Life · Share · 鸭哥调研

MCP 去状态,OpenAI 加状态:两条相反的路

MCP 在 2026 年 7 月的候选版里把会话编号删了,每个请求自己带齐信息,任何服务器实例都能接,解决了之前负载均衡下会话找不到导致 404 的故障。OpenAI 走的是反方向,从 2025 年 3 月起用 Responses API 把推理状态、对话历史和托管工具都留在服务端。社区实测这个有状态接口比无状态的 Chat Completions 慢...

推荐理由:MCP 去状态、OpenAI 加状态,这是 2026 年 7 月 Agent 基础设施层面最清晰的一次路线分歧。文章不光给了观点,还拿出了复现故障的步骤、时间线和工程判断,不是空对空的分析。分数卡在 85 以下,因为这是单源分析,没有多方验证,但信息密度和时效性够上 featured。

AI HOT 精选

扎克伯格内部承认:AI 智能体开发进度没达到预期

扎克伯格在 Meta 内部员工大会上说,AI 智能体(让模型进业务流程干活的系统)的开发速度没有高管们之前想的那么快。今年早些时候 Meta 裁了约 8000 人,又把 7000 人转岗到 AI 相关部门,但扎克伯格承认这次裁员做得不够“干净”,新架构的好处也还没兑现。他预计未来 3 到 6 个月能看到 AI 投资带来的改善。Meta 今年计划在 AI...

推荐理由:扎克伯格在内部员工大会上的原话,不是新闻稿。他直接说 AI 智能体开发没高管想得那么快,还承认裁员做得不够干净、新架构好处没兑现,这种内部交底比产品发布更有信号意义。给出了 3 到 6 个月的改善预期,加上 8000 人裁撤、7000 人转岗的硬数字,对关注 AI 落地节奏的人是个实在的参照点。信息来自 TechCrunch 独家,不是通稿。扣分项是这只是一次讲话复述,不是产品动作,而且 Meta 的智能体路线图之前已经公开过。

Hacker News 首页

QUALITY.md:一份开放规范,让团队和 AI 助手对项目“好”的标准达成共识

QUALITY.md 是一个实验性的开放文件格式,把项目的质量模型——安全、可维护性、测试标准等——写进一个文件里。配套的 /quality 助手技能和命令行工具能自动生成评估报告和按优先级排好的改进建议,可以直接交给 Claude Code 或 Codex 跑循环。项目是开源的,正文没提收费,目前免费上手。

推荐理由:开源、可运行的工具链,直接对接 Claude Code 和 Codex,对用 agent 写代码的人有实际用处。分数定在 72 是因为项目还很早期,正文没披露任何采用数据,目前只是一个实验性的规范,效果和社区接受度都还没验证。