跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 981–1000 条 · 共 1,465 条

5月13日星期三

Hacker News 首页

Rotunda:一个专为 AI 智能体设计的浏览器,能模拟人类打字节奏

Pierce 发布了 Rotunda,一个基于 Firefox 150 的浏览器,专门给 Claude、Codex 这类 AI 智能体用。它最大的不同是能模拟人类的鼠标移动和键盘输入节奏——作者用自己一周的操作数据训练了一个 RNN 模型来生成这些时序,让智能体操作网页时看起来更像真人。控制方式有两种:命令行或者 Playwright API,方便接入...

推荐理由:Rotunda 把 Firefox 150 改成了给 Claude、Codex 这类工具用的浏览器,核心卖点是拿 RNN 模拟人类敲键盘、动鼠标的时序,让网站不容易识别出是机器在操作。接入方式走 CLI 或 Playwright API,对已经在用 Playwright 的人上手成本低。不过目前只是一个 Show HN 的开源仓库,正文没披露实际跑在哪些业务里、也没给延迟或成功率数据,所以效果到底怎么样还得看后续验证。

AI HOT 精选

Cursor 给云端 AI 编程助手配上了开发环境,支持多仓库和 Dockerfile 配置

Cursor 发布了一套给云端 agent 用的开发环境工具。现在一个环境里能挂多个代码仓库,让 agent 跨仓库改代码、跑测试。环境配置改用 Dockerfile 来管,支持构建密钥,缓存命中时构建速度能快 70%。不想手写 Dockerfile 的话,Cursor 可以自动检查你的仓库并生成一份可编辑的配置,这个功能还在内测。环境还加了版本历史、...

推荐理由:Cursor 给智能体配了个云端开发环境,不是简单加个按钮,而是把多仓库、Dockerfile、审计日志和环境权限都塞进去了。缓存命中后构建能快 70%,这个数字挺实在,说明他们不是只做了个壳。我会先打个折:正文没提安全隔离做到什么程度,也没说缓存命中率在真实项目里能到多少,所以别急着当万能方案。但整体看,它解决的是让模型进业务流程干活时环境乱、权限杂、构建慢这几个真问题,对从业者来说值得关注。

OpenAI News

OpenAI 给 Windows 版 Codex 造了个沙箱,让编程助手能干活又不乱碰文件

Codex 是 OpenAI 的编程助手,能在开发者电脑上直接跑命令。Windows 版之前没有沙箱,用户要么得每条命令都点同意,要么就得开“完全访问”把安全交给运气。OpenAI 工程师 David Wiesen 写了篇文章讲他们怎么从零给 Windows 造沙箱。他们先看了 Windows 自带的几个方案:AppContainer 管得太死,编程助...

推荐理由:OpenAI 给 Windows 版 Codex 搭了个安全沙箱,主要管两件事:文件访问和网络连接。我会先打个折——正文没披露沙箱的技术方案,比如是容器还是虚拟化、权限粒度到哪一层,所以没法判断它到底有多硬。但这条消息对做 coding agent 的人很实际,因为文件系统和网络就是最容易出事的两个面。

AI HOT 精选

百度上线妙答应用与企业版,称应用自身 90% 代码由妙答自己生成

百度发布了妙答应用和妙答企业版,把编程助手开放给更多开发者和公司。官方说妙答应用里 90% 的代码是妙答自己写的,这个数字说明代码生成能力已经能撑起一个完整产品的大部分开发量。截至目前,妙答生成的应用累计服务超过 1000 万用户,应用总价值标称 50 亿元人民币。不过正文没披露这 50 亿是怎么算出来的,也没给出企业版的具体定价或与现有竞品的对比,这...

推荐理由:我会先打个折:90% 自生成代码这个数,正文没披露是怎么统计的,是行数占比还是模块占比,也没说剩下 10% 是人写的还是用别的工具生成的。1000 万用户和 50 亿总价值同样缺口径说明,是累计还是年化、是 GMV 还是合同额都不清楚。但即便有这些信息缺口,一个代码工具敢说自己大部分代码是自产的,本身就是一个很强的信号,比单纯宣布“上线了”要有意思得多。对做 AI coding 和 agent 的团队来说,这个案例可以直接拿来当参考,所以值得放进 featured 但分数不往上拉。

量子位 · 公众号

百度发布秒哒3.0,8岁小孩也能把想法变成手机App

百度在2026 Create大会上推出了秒哒3.0,一个无代码开发平台。这次更新直接支持生成iOS和安卓App,还能打包成安卓安装包、在线热更新。企业版加了三级权限、环境隔离和服务等级协议。现场演示里,一个8岁小学生用语音说了几个想法,平台就自动生成了一个完整应用。不过正文没披露这个演示App的实际复杂度和后续维护成本,也没说生成代码的质量和可维护性怎么样。

推荐理由:秒哒3.0这次主要把应用生成从网页端扩展到了iOS和Android,还加了安卓打包和热更新,等于让不会写代码的人也能直接出手机应用。企业版给了三级权限和SLA,明显在往团队和公司场景推。我会先打个折:标题里“8岁小学生”的案例正文没给出具体细节,不知道是完整可用应用还是简单页面,这点先别太激动。整体是产品功能更新,不是底层模型换代,但移动端生成和打包能力对低代码赛道有实际推进。

机器之心 · 公众号

林俊旸被曝离职创业,新 AI 实验室估值冲到 20 亿美元

The Information 爆料,阿里通义千问前技术负责人林俊旸正在为一家新 AI 实验室融资,目标融几亿美元,投后估值可能到 20 亿美元。目前实验室具体研究方向、团队规模和最终估值都还没公开。

推荐理由:这条消息我会先打个折:目前只有 The Information 的融资传闻和估值数字,研究方向、团队构成、产品计划一概没提。亮点是林俊旸本人从阿里出来单干,新 Lab 估值直接喊到 20 亿美元,说明资本还在抢头部 AI 人才。但正文没披露最终估值是否敲定、钱从哪来、做什么方向,这些关键信息都缺着,所以先当一条人才+融资信号看,别太激动。

r/LocalLLaMA

小米把 1 万亿参数的 MiMo-V2.5-Pro 开源了,但自己跑真的划算吗?

小米放出了 MiMo-V2.5-Pro,参数总量 1.02 万亿,但每次推理只激活 420 亿参数,上下文窗口能塞进 100 万个 token,用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务,走 API 总共花了 70.12 美元,处理了约 3.87 亿个 token,缓存命中率高达 96.3%。这个命中率说明大部分请求其实...

推荐理由:我会先打个折:正文没披露 MiMo-V2.5-Pro 的评测跑分,所以性能好坏只能靠参数规模猜。但这条信息本身够直接——小米把一个 1.02 万亿参数、42B 激活的模型开源,另一边作者用 Claude Code 跑了 125 次会话,3.87 亿 token 花了 70.12 美元,缓存命中率 96.3%。这两组数字摆在一起,自建成本和 API 开销的对比就出来了。对做工程的人,这种一手成本数据比技术报告更有参考价值。

AI HOT 精选

Google 出了第一款围绕 Gemini 做的笔记本 Googlebook,不再是 Chromebook 那种云优先的路子

Google 发了台叫 Googlebook 的笔记本,系统层面把 Gemini 塞了进去。这次说了三个功能:Magic Pointer 把光标变成一个 AI 入口,点哪都能弹出上下文建议和任务;Create Your Widget 让你用大白话描述需求,自动生成一个能聚合不同信息的桌面小组件;还打通了安卓生态,在电脑上直接调用手机 App 和文件。正...

推荐理由:我会先打个折:正文没披露具体配置、价格、上市时间和实际演示,所以没法往更高分打。但“Googlebook”这个命名和围绕 Gemini Intelligence 的设计,说明 Google 想把 AI 做成笔记本的原生能力,而不是外挂一个助手。三项机制里,Magic Pointer 听起来像用意图预测代替传统光标操作,自然语言生成小组件是把“说人话就能搭界面”搬到桌面,Android 跨设备访问则打通了手机和笔记本的协同。这些点加起来,让这条消息在 AI 从业者眼里有讨论价值,但缺细节也意味着落地效果还得观望。

TechCrunch · AI

Medicare 新支付模型 ACCESS 给 AI 留了买单通道,科技圈还没反应过来

美国联邦医保 Medicare 推出了一个叫 ACCESS 的新支付模型,第一次允许医疗机构为“两次门诊之间照顾病人”的服务向政府要钱。以前没有报销机制能覆盖这类工作:比如 AI 打电话问病人有没有按时吃药、帮忙协调住房转介、确认处方药有没有取。ACCESS 把这个口子打开了。文章没披露具体费率、哪些州先试点、什么时候落地,也没说对 AI 供应商的准入...

推荐理由:这条消息对做医疗 AI 的人是个信号:Medicare 开始给 agent 类服务留支付接口了。我会先打个折,因为正文没披露支付标准、上线时间和适用州,没法判断落地节奏。但光是“支付模型为 AI 设计”这个提法,就比大多数产品更新更值得关注,所以放在 featured 中档。

AI HOT 精选

Claude Code 加了个 /goal 指令,让模型自己跑到任务做完

Claude Code 新上线了 /goal 功能,你下完指令后 Claude 会持续干活直到任务完成,不用人在旁边盯着。帖子没写这个功能怎么触发、哪些版本能用、要不要额外付费,也没提任务卡住或跑偏时怎么处理。

推荐理由:HKR 三项都过,因为 /goal 解决的是 Claude Code 用户常遇到的 agent 中途停摆问题。这只是 Anthropic 单功能更新,细节披露不多,所以放在 featured 低位,不算当天重磅消息。

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。

AI HOT 精选

OpenAI 演示 Codex 在 Mac 上跨应用后台干活,不用占着你的电脑

OpenAI 开发者账号发了一段演示,Codex 能跨 Mac 应用点击、输入、在后台持续执行任务,不会锁住你的鼠标键盘。视频里 @AriX 和 @romainhuet 聊了这种代理能干的事,但正文没披露发布时间、权限怎么设计、以及这次开放给哪些用户。

推荐理由:我会先打个折:正文只有一段演示描述,没给发布时间、权限模型、可用范围,所以重要性停在 76 分。钩子很直接——Codex 能在 Mac 后台帮你跨应用点按钮、填文字,听着像本地 RPA 但由模型驱动。这点先别太激动,因为没交代它怎么拿系统权限、会不会误操作、有没有沙箱。对开发者来说,这要么是桌面 agent 的一大步,要么是个安全坑,得等更多细节。

AI HOT 精选

Anthropic 安全团队用自家 Claude Code 搭了个威胁检测平台,一天出原型、一周上线

Anthropic 的检测平台工程团队用 Claude Code 开发了 CLUE 威胁检测与响应平台。他们一天就做出了概念验证,一周完成交付。这个平台把安全分析员查日志的时间从几小时压缩到了几分钟。文章是团队技术负责人 Jackie Bow 写的,主要讲他们怎么用 Claude Code 自动处理告警、加速调查,但没披露具体用了哪些模型、实际误报率多...

推荐理由:这是 Anthropic 安全团队自己吃狗粮的案例,不是 Claude Code 功能发布。CLUE 平台和一天 PoC、一周交付的时间线让它刚好够上 featured 门槛,但我会先打个折——内部案例的通用性还没验证,正文也没披露误报率、处理量这些硬指标。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

AI HOT 精选

Claude 给律师和法务做了一套专用工具,能直接进 Word 和 Outlook 干活

Anthropic 发布了 20 多个 MCP 连接器和 12 个法律专用插件,让 Claude 能直接操作合同管理系统、研究平台、文档管理和电子取证软件。具体来说,它可以在 Word 里起草和修改合同,在 Outlook 里处理日常法律流程,还能做条款对比。正文没披露这些工具的实际准确率、客户测试数据或定价,所以效果和成本现在还没法判断。

推荐理由:Anthropic 这次不是发模型,而是给 Claude 配了一套法律行业的“工具包”:20 多个 MCP 连接器加 12 个插件,直接嵌进 Word 和 Outlook 里干活,合同起草、修订、条款比对都能做。我会先打个折——正文没披露这些连接器具体覆盖哪些系统、插件是自己做的还是第三方接的,也没给实际客户案例或效率数据,所以“省了多少时间”现在说不清。但方向很明确:让模型进业务流程干活,而且选了一个对准确率要求极高、人工成本也高的行业。如果是真的跑通了,律所和法务团队的重复劳动会被吃掉一大块。这点先别太激动,等看有没有律所站出来说实测结果。

AI HOT 精选

谷歌在 Android Show 2026 上发了新助理 Android Intelligence,能跨 App 自动干活

谷歌这次推的 Android Intelligence 是一个系统级智能助理,主打跨安卓应用的多步骤自动化任务,比如你让它订咖啡、回消息、填表,它可以自己切 App 完成。Chrome 里的 Gemini 也加了浏览器操作能力,能直接帮你操作网页。另外还有语音笔记转文字功能叫 Rambler,以及可以自定义的生成式 UI 小组件。整场发布没提具体推送时...

推荐理由:这条消息抓人是因为安卓系统级的智能助理,能跨 App 自动操作,不是某个 App 的小修小补。具体放出的功能点挺实在:Chrome 里让 Gemini 直接帮你用浏览器、自动填表、语音转文字,还有可定制的小组件,都是开发者能马上摸到的界面。正文没给技术细节和实际延迟数据,所以效果先打个折。但这件事本身是移动 AI 代理的卡位战,对做工具和分发的团队来说,风向意义大于单点功能。

Hacker News 首页

Hopper:给大型机配了一个能看懂 z/OS 的 AI 操作界面

Hypercubic 发布了 Hopper,一个把 AI 助手直接塞进大型机开发流程的桌面工具。它自带真实的 TN3270 终端,AI 能识别 ISPF 面板、写严格对齐列位的 JCL 作业、把 SDSF 里的失败信息翻译成具体的异常码和出错行,还能像查 SQL 一样查询 VSAM 数据集。编译、测试、上线可以一条指令完成,但每次改动前会暂停等你批准,...

推荐理由:Hypercubic 这个 Hopper 把 TN3270 终端、z/OS 面板和 AI agent 揉在一起,让 agent 能直接操作大型机上的 COBOL 系统,敏感步骤还得人工点个头才放行。想法挺有意思,但正文没给出任何客户、定价或实际跑起来的效果数据,目前只是 Show HN 阶段的小团队产品展示。我会先打个折,等有真实案例再往上调。

AI HOT 精选

Google 用 ADK 搭了一个能跑几周不丢上下文、会自己暂停和恢复的 AI 助手

Google 开发者博客发了一篇教程,用自家的 Agent Development Kit(ADK)搭了一个“新员工入职协调助手”。这个助手能跑好几周:发完欢迎邮件就自己暂停,等员工签完文件再继续,中间还能把装电脑的活派给另一个专门的小助手,最后发一份定制的第一天日程。文章没给具体性能数据,但重点讲了三个让 demo 变生产可用的架构思路:用结构化的持...

推荐理由:Google Developers 这篇教程没发新模型或新平台,但把长时运行智能体的持久化机制讲得很实在:状态机管流程、会话存储保上下文、Webhook 接外部系统。我会先打个折,因为只是工程实践分享,不是重大发布,但对正在落地 agent 的团队来说,这种能跑几天不丢状态的方案比很多 demo 更有用。

TechCrunch · AI

Google 在 Android Show 上发了什么:AI 笔记本、能帮你干活的 Gemini、随口说说的桌面小部件

Google 在 I/O 大会前办了一场 Android Show,把 Gemini 助手塞进了更多地方。新发布的 Googlebooks 笔记本主打 AI 优先,但正文没披露具体配置、价格和上市时间。Gemini 变得更“代理化”,意思是它能跨 App 帮你完成一连串操作,不过实际效果还得看落地。Android 桌面小部件现在支持“vibe codi...

推荐理由:Google 在 I/O 前一口气甩出好几个 Gemini 相关的 Android 更新,我会先打个折:正文没给参数、没标价格、也没说什么时候能用上,所以只能当产品信号看。比较有意思的是 vibe-coded widgets,等于让用户用自然语言描述就能生成桌面小组件,门槛降得很低;Googlebooks 则像是把笔记和 Gemini 的搜索/总结能力缝在一起,能不能打还得看实际体验。整体属于有话题但缺验证的 mid-weight 产品更新。