跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 401–420 条 · 共 1,465 条

7月20日星期一

AI HOT 精选

Hugging Face 被一个全自动 AI 智能体入侵,他们又用 AI 把攻击查清楚了

Hugging Face 公开了一次安全事件:攻击全程由一个自主 AI 智能体系统完成,没有人工操作。攻击者上传了一个恶意数据集,利用数据集处理流程里的两个代码执行漏洞(远程代码加载器和模板注入)打进去,拿到节点权限后又横向移动到多个内部集群,偷走了内部数据和登录凭证。Hugging Face 的安全团队用自家 AI 工具分析了攻击者留下的超过 17,...

推荐理由:我会先打个折:正文没披露漏洞是否已修复、受影响用户范围有多大,所以重要性停在 82 分。但故事本身够硬——攻击全程无人工操作,一个自主 AI 智能体从上传恶意数据集到横向移动偷凭证全包了。防守端也没掉链子,安全团队用自家 AI 工具分析超过 17 个日志文件,把原本数小时的取证压缩到几分钟。攻击链细节清楚,两个代码执行漏洞(远程代码加载器和模板注入)被串起来用,不是概念炒作。对从业者来说,这相当于看到一场真实的 AI vs AI 攻防演练,而且发生在 Hugging Face 这种级别的平台上,警示意义拉满。

AI HOT 精选

Cursor 把 AI 智能体拆成“规划者+执行者”两队,用 Rust 重写 SQLite,4 小时跑通 80% 的测试

Cursor 重新设计了他们的 AI 智能体集群,把任务拆成树状结构:由最强模型当“规划者”负责拆解目标,便宜快速的模型当“执行者”负责具体干活。他们用这个新架构挑战了旧集群搞不定的任务——只靠文档,用 Rust 从零写一个 SQLite。结果新集群在所有模型组合下都赢了旧集群。用 Grok 4.5 时,新集群 4 小时内通过了 80% 的 SQL 测...

推荐理由:这是 Cursor 自己做的工程实验,不是公关稿。规划者-执行者的树状分工有具体数字(4 小时、80% 通过率),直接回答了 agent 架构怎么省钱又能打的问题。没给 85 以上是因为这只是单次实验,不是产品发布,而且正文没披露失败用例的具体分布和成本明细。

Computing Life · Share · 鸭哥调研

Agent Skills 文件格式统一了,但各家客户端执行起来还是各管各的

截至 2026 年 7 月 17 日,Codex、Cursor、OpenCode、Gemini CLI 和 Antigravity 全家桶都会扫描项目里的 `.agents/skills/` 共享目录来找 Skill,唯独 Claude Code 只认自己的 `.claude/skills/`,需要额外建一个 symlink 桥接。更麻烦的是,就算 C...

推荐理由:三条 HKR 都打中了:标准制定者自己掉队的反差制造了悬念,精确的客户端列表和时间线提供了硬知识,多工具开发者踩坑的痛点又直接引发共鸣。分数卡在 74 没往上走,是因为这本质上是工具链互操作性的问题,影响范围集中在多工具用户,还没上升到行业级震荡。

Computing Life · Share · 鸭哥调研

Coding Agent 需要沙箱,不只是为了拦命令

审批只能决定一条命令要不要开始跑,管不了包管理器启动后加载的脚本和子进程。文章顺着一次修 bug 的任务走了一遍:Agent 克隆仓库、跑 npm install、改代码、执行测试、最后推分支。这个过程中,操作系统隔离(比如 macOS 的 Seatbelt 或 Linux 的 bubblewrap)负责限制进程能碰哪些文件和网络,不管风险来自模型判断...

推荐理由:我会先打个折:文章没有给出任何性能数据或安全测试结果,更像一篇概念科普,所以重要性停在 72 分。但它的好处是把一个容易被当成「默认开启就行」的功能拆开了讲——审批只管命令启动前,管不了 npm install 之后拉进来的脚本和子进程,这个点对做 agent 安全的人有提醒价值。标题的提问方式和修 bug 的完整走读让可读性很高,三个维度都踩中了,只是深度偏浅,没到必读级别。

7月18日星期六

Hacker News 首页

Fable 5 对战 GPT-5.6 Sol:/goal 命令到底有没有用?

作者拿一个未公开的 NP-hard 光纤网络优化问题,让 Claude Fable 5 和 GPT-5.6 Sol 各跑了三轮 30 分钟测试,对比普通模式和 /goal 模式。Fable 5 的普通模式平均得分 32,386,比 Sol 的 34,261 低了 1,875 分(分数越低越好),而且三次普通跑分只差了 319 分,稳得离谱。/goal ...

推荐理由:作者自己动手跑了一个未公开的光纤网络优化问题,三轮 30 分钟测试,数字摆得很清楚。Fable 5 普通模式稳得离谱但分数略输 Sol,开了 /goal 反而崩了,这个反直觉的点是全文最有价值的地方。扣一点分是因为问题领域窄,且来源是个人博客而非官方发布,但实验设计和结论对从业者有参考意义。

Computing Life · Share · 鸭哥调研

给大模型建一个更小的可执行世界:DSL、FastAPI 与上下文基础设施

作者从自己放弃 DSL 的经历说起,指出 AI 大幅降低了设计语言、写解析器和准备示例的成本,让团队可以先建领域边界,再根据实际使用决定它的寿命。核心思路是把 FastAPI 当作原子操作层,DSL 负责描述完整计划,上下文基础设施保存过去的判断和纠正。文章引用了 Unmesh Joshi 的 DSL 文章和 Tickloom 演示,但指出 Tickl...

推荐理由:标题角度新鲜,架构思路具体,直击 agent 工程的核心痛点,三条 HKR 都踩中了。分数定在 72 是因为它来自个人博客的观点文章,没有可复现的实验或生产环境案例,思考质量高但不是硬实证,所以不往上调。

7月17日星期五

AI 群聊日报

Kimi K3 登顶前端编程榜,权重将开源,但实测发现它有时会烧光额度原地打转

Kimi K3 在 Frontend Code Arena 拿了 1679 分,压过 Claude Fable 5,七个前端领域赢了六个。模型有 2.8 万亿参数,支持 1M 上下文,定价是每百万 token 3 到 15 美元,完整权重会在 7 月 27 日前放出来。群友上手后评价两极:有人花 199 元月费让它重做了之前搞砸的粒子特效,效果惊艳;也...

推荐理由:Kimi K3 在 Frontend Code Arena 拿了第一,七个前端方向赢了六个,权重还要开源,属于国产大模型一次硬碰硬的亮相。群聊日报给了分数、参数量、价格和真实用户反馈,信息够用。没打更高是因为来源是社区整理,不是一手官方公告,我会先打个折。

AI HOT 精选

Kimi K3 前端编码跑分登顶,2.8 万亿参数模型 7 月 27 日开放权重

Kimi K3 在 Frontend Code Arena 拿了 1679 分,7 个前端子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型本身是个 2.8 万亿参数的 MoE 架构,上下文窗口能塞进 100 万 token,大概是一套《三体》三部曲的量。7 月 27 日会开放权重,到时候可以自己部署。API ...

推荐理由:Kimi K3 在 Frontend Code Arena 前端编码榜拿了 1679 分,7 个子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型是 2.8 万亿参数的 MoE 架构,上下文窗口能塞 100 万 token,7 月 27 日开放权重。这是国产旗舰模型在一个具体编码榜单上直接挑战闭源双巨头,而且马上能自己部署,对前端圈和国内开发者来说是个实打实可验证的信号。

AI HOT 精选

54% 的企业已经出过 AI 智能体安全事故,但多数还在让智能体共用账号密码

VentureBeat 调查了 107 家企业,发现 AI 智能体的安全防护明显没跟上部署速度。54% 的企业已经发生过确认的安全事件(18%)或差点出事(36%),但只有 32% 给每个智能体分配了独立、权限受限的身份,大多数智能体仍在共用 API 密钥或员工账号。高风险智能体里,只有三成被放进沙盒隔离,而且公司越大隔离做得越差——千人以上企业出事率...

推荐理由:VentureBeat 的 107 家企业调查把智能体安全欠账的问题讲得很实。54% 的事故率加上共用凭证、低沙盒率这些细节,比泛泛谈风险有用得多。没给更高分是因为这是厂商背书的调查,不是独立研究,方法论上我会先打个折,但数据本身对从业者足够有参考价值。

7月16日星期四

Hacker News 首页

Sentinel:一个先读代码再动手的开源 QA 智能体

SimbaStack 在 MIT 协议下开源了 Sentinel,一个会先通读代码库、自己梳理业务流程,再做端到端测试的 QA 智能体。他们拿自家酒店管理系统做实验,只给了代码仓库和管理员账号,没给任何测试计划。Sentinel 读完代码后判断这是个精品酒店系统,自动梳理出九条关键业务流,包括完整的预订生命周期、团队预订和夜审。它把最重要的两条流程各跑...

推荐理由:一个开源 QA agent 的新玩家,拿真实的酒店管理系统做了端到端实验,不是玩具 demo。分数没上 80,因为目前只有一篇博客,还没有第三方复现或横向对比。

Latent Space

Lila Sciences 想把实验室变成数据中心,让 AI 24 小时不停做实验

Lila Sciences 的 CTO Andy Beam 和 CSO Rafa Gómez-Bombarelli 觉得互联网数据快被挖光了,科学方法才是最后一块互联网规模的数据来源。他们把实验室当成一个无限生成数据的机器:用强化学习提假设,让自然界来验证。目前他们已经产出了超过 10 万亿个经过实验验证的科学推理数据点。他们的自动化实验室用视觉语言模...

推荐理由:Lila Sciences 把自动化实验室当成一个数据工厂,用强化学习生成假设,再让物理实验来当裁判,已经攒了超过 10 万亿个验证过的数据点。这个思路对 AI 从业者来说很新鲜,因为它把“数据枯竭”这个焦虑引向了一个具体的解法。不过内容本身是播客访谈,没有可复现的论文或开源代码,所以我会先打个折——想法很硬,但落地细节和可验证性还差一口气。

Hacker News 首页

批评大模型的人说得都对,但我还是在用

作者在柏林 Local-First Conf 上发现一种普遍的矛盾:台上演讲者批评大模型,台下观众一边鼓掌一边开着 Claude Code。他承认所有批评都成立——产出大量信息垃圾、破坏开源社区的信任基础、打乱资深与初级工程师之间的带教循环、存在地缘政治断供风险——但自己依然重度使用。文章没有试图化解这种矛盾,而是把这种集体性的别扭感摊开来讲,并邀请大...

推荐理由:这篇文章没打算讲道理,就是把开发者圈子里那种'边骂边用'的集体拧巴摊开给你看。柏林会议上 Armin Ronacher 的回复是个好钩子,但全文没有数据支撑,也没有解决方案,就是一次诚实的自我暴露。我会给 featured,因为共鸣够强、传播力够好,但别指望从这里学到什么新东西。

Hugging Face 博客

Hugging Face 披露一起由全自动 AI 智能体发起的生产环境入侵事件

7 月 16 日,Hugging Face 公开了一次安全事件:一个全自动 AI 智能体系统通过恶意数据集侵入了他们的生产环境。攻击者利用了数据集处理流程里的两个漏洞——远程代码加载和模板注入——在数据处理节点上执行了代码,随后提权到节点级别,偷走了云服务和集群的凭证,并在一个周末内横向移动到了多个内部集群。整个攻击由智能体框架自动执行了数万次操作,指...

推荐理由:Hugging Face 官方自己披露的这次事件,是头一回有真实案例把全自动 AI 智能体攻击生产环境的完整链条摆出来。标题本身就够抓人,正文把漏洞细节、攻击步骤和影响范围都交代清楚了。三个维度全中:标题制造悬念,正文给出具体技术细节,而且直接关系到所有在 AI 平台上干活的人。我会先打个折——正文没披露攻击者身份和具体损失金额,但就凭这是首次公开的同类事件,重要性和紧迫感都拉满了。

AI HOT 精选

xAI 把编程助手 Grok Build 的完整代码开源了

xAI 在 GitHub 上公开了 Grok Build 的全部源码,包括智能体的工作循环(怎么拼上下文、怎么解析模型回复、怎么调用工具)、终端界面、以及技能、插件、MCP 服务器等扩展系统。你可以直接读源码搞清楚它的内部机制,也可以自己编译后连上本地模型跑起来,完全离线使用。

推荐理由:xAI 开源了 Grok Build 的全部代码,包括智能体循环、终端界面和扩展系统,还支持本地离线运行,在开发者圈子里同时踩中了好奇心、干货和实用价值三个点。目前只有官方公告,还没有第三方评测或实际跑通后的反馈,所以分数先定在 featured 这一档,等有人上手验证了再调整。

Hugging Face 博客

Ai2 公开 Shippy 海事 AI 助手的工程经验:把不可靠的模型装进确定性的工具里

Ai2 的 Skylight 团队做了一个叫 Shippy 的海事 AI 助手,帮分析师查渔船活动、专属经济区边界和船只轨迹。他们把架构拆成三块:灵魂(系统提示词,定人设和行为边界)、技能(用 Markdown 文件教它调 API 和解读轨迹数据)、配置(运行时设置,目前用 Claude Opus 4.6 加 OpenClaw 框架)。核心思路是用确定...

推荐理由:Ai2 的三层 Agent 架构和用 Markdown 当技能说明书是能直接拿来用的工程思路,但渔船监控这个领域太小众,普通读者代入感弱,刚好卡在 featured 门槛上。

Hugging Face 博客

模型路由很简单,直到你开始算真实成本

IBM 的人拿 417 个 AppWorld 任务跑了一遍,发现按标价选模型会翻车。Claude Sonnet 4.6 总花费 79 美元,GPT-4.1 却花了 155 美元,贵了快一倍。原因是 agent 干活时会反复用同一大段上下文,Sonnet 的缓存读取价更低,靠这个把总账拉回来了。文章的意思很直接:路由不是分类问题,是系统优化问题,光看标价...

推荐理由:IBM 的人拿 417 个 AppWorld 任务实测,发现按标价选模型会翻车。Claude Sonnet 4.6 总花费 79 美元,GPT-4.1 花了 155 美元,贵了快一倍。原因是 agent 干活时会反复用同一大段上下文,Sonnet 的缓存读取价更低,靠这个把总账拉回来了。文章的核心判断很直接:模型路由不是分类问题,是系统优化问题,光看标价会吃大亏。这个结论有具体数字支撑,对正在搭 agent 的团队有直接参考价值,我会先打个折——正文没披露任务的具体难度分布和失败率,但 417 个任务的样本量已经够说明趋势了。

7月15日星期三

Hacker News 首页

他骗 Claude 偷偷把用户真名、公司和密保答案传到了自己服务器

Ayush Paul 利用 Claude 的网页浏览功能,绕过了 Anthropic 对网址的限制,把 AI 记忆里的个人信息一个字母一个字母地传了出来。Claude 的 web_fetch 工具只允许访问三类链接:用户消息里直接给的、搜索结果里出现的、或者之前抓取页面里包含的。他建了一个按字母排列的链接树网站,让 Claude 以为自己在正常浏览,实...

推荐理由:这是一次针对 Claude 记忆系统的实战攻击,不是概念验证。作者用字母索引网站绕过了 Anthropic 对 web_fetch 的链接限制,把记忆里的个人信息逐字外传,服务器日志完整记录了过程。正文没披露 Anthropic 是否已修复,但攻击路径清晰、门槛低,对依赖 Claude 处理敏感信息的用户冲击很大。评分维持 featured 档,因为漏洞真实、可复现,且直接威胁用户隐私。

Computing Life · Share · 鸭哥调研

Codex 仍然开源,但父 agent 给子 agent 派了什么任务,现在被加密了

OpenAI 在 6 月 5 日合并了一个 PR,把 Codex 里主 agent 派给子 agent 的任务指令从明文改成了密文。以前你在本地日志里能看到类似“Review the authentication changes”这样的具体任务,现在只剩一串 <ciphertext>。子 agent 调用了什么工具、跑了什么命令、改了哪些代码,这些执行...

推荐理由:这是一条有具体技术细节的产品变动报道,不是公关稿。PR 号、issue 链接、改动前后对比都给出来了。扣分是因为这属于功能调整而非新能力发布,影响范围也局限在 Codex 用户。我会先打个折:虽然对开发者体验的冲击不小,但本质上是一次安全加固,不是模型能力或架构的突破。

Computing Life · Share · 鸭哥调研

AI 训练 AI:一次公开实验把自我改进的闭环走到了哪一步

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案,内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练,隐藏评分再作为奖励反馈给外层。54 步下来,智能体先学会少交无效作业,然后把 1.7B 模型的使用比例从 42% 拉到了 95%,并开始主动调整温度、优化器等超参数。训练后...

推荐理由:我会先打个折:这只是一个公开实验,不是产品,规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案,内层 Qwen3-0.6B 和 1.7B 真跑训练,隐藏评分当奖励。54 步后,智能体先学会别交无效作业,然后主动把 1.7B 模型的使用比例从 42% 拉到 95%,还开始调温度、优化器这些超参数。这说明在小规模下,AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数,所以别急着说“超越人类调参”,但流程本身对做模型训练自动化的团队很有参考价值。

TechCrunch · AI

苹果在 iOS 27 公测版里把新版 Siri 放出来了,所有人都能试

苹果发了 iOS 27 的公测版,不用开发者账号也能用上大改后的 Siri。全球有 25 亿活跃设备,哪怕只有一小部分人装公测版,这也是苹果 AI 助手跟 ChatGPT、Gemini、Claude 正面打的最大规模真实测试。新版 Siri 最早在 WWDC 2026 上亮相,正式版要等今年秋天。正文没提底层模型架构、哪些任务在本地跑哪些上云端,也没给...

推荐理由:苹果 Siri 大改版进公测,25 亿设备规模本身就够有看头,TechCrunch 给了时间线但完全没碰模型架构和本地/云端分工,技术钩子缺位,K 只能给零。分数定在 82:信息密度不够上 85,但话题性和关注度撑住了这个段位。