跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 321–340 条 · 共 760 条

5月13日星期三

AI HOT 精选

OpenAI 演示 Codex 在 Mac 上跨应用后台干活,不用占着你的电脑

OpenAI 开发者账号发了一段演示,Codex 能跨 Mac 应用点击、输入、在后台持续执行任务,不会锁住你的鼠标键盘。视频里 @AriX 和 @romainhuet 聊了这种代理能干的事,但正文没披露发布时间、权限怎么设计、以及这次开放给哪些用户。

推荐理由:我会先打个折:正文只有一段演示描述,没给发布时间、权限模型、可用范围,所以重要性停在 76 分。钩子很直接——Codex 能在 Mac 后台帮你跨应用点按钮、填文字,听着像本地 RPA 但由模型驱动。这点先别太激动,因为没交代它怎么拿系统权限、会不会误操作、有没有沙箱。对开发者来说,这要么是桌面 agent 的一大步,要么是个安全坑,得等更多细节。

AI HOT 精选

Anthropic 安全团队用自家 Claude Code 搭了个威胁检测平台,一天出原型、一周上线

Anthropic 的检测平台工程团队用 Claude Code 开发了 CLUE 威胁检测与响应平台。他们一天就做出了概念验证,一周完成交付。这个平台把安全分析员查日志的时间从几小时压缩到了几分钟。文章是团队技术负责人 Jackie Bow 写的,主要讲他们怎么用 Claude Code 自动处理告警、加速调查,但没披露具体用了哪些模型、实际误报率多...

推荐理由:这是 Anthropic 安全团队自己吃狗粮的案例,不是 Claude Code 功能发布。CLUE 平台和一天 PoC、一周交付的时间线让它刚好够上 featured 门槛,但我会先打个折——内部案例的通用性还没验证,正文也没披露误报率、处理量这些硬指标。

AI HOT 精选

Claude Opus 4.7 快速模式开放研究预览,API 和 Claude Code 都能用

Anthropic 把 Claude Opus 4.7 的快速模式放出来了,现在可以在 API 和 Claude Code 里用,但还挂着研究预览的标签。正文没提模型参数量、具体定价、调用频率限制,也没说什么时候转正式版。如果是真的快又便宜,对日常开发场景会挺实用,不过这些关键信息都缺着,先别急着切生产环境。

推荐理由:我会先打个折:正文只说了开放研究预览,没披露模型大小、定价、速率限制和正式上线时间,所以别当成品看。但这条消息对用 Claude Code 干活的人很实在——快速模式意味着写代码、调工具的等待时间可能明显缩短,工作流会顺很多。信息缺口主要在成本和规模上,没这些数字就没法算账,这点先别太激动。整体判断挂在延迟改善和开发者体验上,信息不够的部分也标清楚了。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

AI HOT 精选

Claude 给律师和法务做了一套专用工具,能直接进 Word 和 Outlook 干活

Anthropic 发布了 20 多个 MCP 连接器和 12 个法律专用插件,让 Claude 能直接操作合同管理系统、研究平台、文档管理和电子取证软件。具体来说,它可以在 Word 里起草和修改合同,在 Outlook 里处理日常法律流程,还能做条款对比。正文没披露这些工具的实际准确率、客户测试数据或定价,所以效果和成本现在还没法判断。

推荐理由:Anthropic 这次不是发模型,而是给 Claude 配了一套法律行业的“工具包”:20 多个 MCP 连接器加 12 个插件,直接嵌进 Word 和 Outlook 里干活,合同起草、修订、条款比对都能做。我会先打个折——正文没披露这些连接器具体覆盖哪些系统、插件是自己做的还是第三方接的,也没给实际客户案例或效率数据,所以“省了多少时间”现在说不清。但方向很明确:让模型进业务流程干活,而且选了一个对准确率要求极高、人工成本也高的行业。如果是真的跑通了,律所和法务团队的重复劳动会被吃掉一大块。这点先别太激动,等看有没有律所站出来说实测结果。

AI HOT 精选

谷歌在 Android Show 2026 上发了新助理 Android Intelligence,能跨 App 自动干活

谷歌这次推的 Android Intelligence 是一个系统级智能助理,主打跨安卓应用的多步骤自动化任务,比如你让它订咖啡、回消息、填表,它可以自己切 App 完成。Chrome 里的 Gemini 也加了浏览器操作能力,能直接帮你操作网页。另外还有语音笔记转文字功能叫 Rambler,以及可以自定义的生成式 UI 小组件。整场发布没提具体推送时...

推荐理由:这条消息抓人是因为安卓系统级的智能助理,能跨 App 自动操作,不是某个 App 的小修小补。具体放出的功能点挺实在:Chrome 里让 Gemini 直接帮你用浏览器、自动填表、语音转文字,还有可定制的小组件,都是开发者能马上摸到的界面。正文没给技术细节和实际延迟数据,所以效果先打个折。但这件事本身是移动 AI 代理的卡位战,对做工具和分发的团队来说,风向意义大于单点功能。

Hacker News 首页

Hopper:给大型机配了一个能看懂 z/OS 的 AI 操作界面

Hypercubic 发布了 Hopper,一个把 AI 助手直接塞进大型机开发流程的桌面工具。它自带真实的 TN3270 终端,AI 能识别 ISPF 面板、写严格对齐列位的 JCL 作业、把 SDSF 里的失败信息翻译成具体的异常码和出错行,还能像查 SQL 一样查询 VSAM 数据集。编译、测试、上线可以一条指令完成,但每次改动前会暂停等你批准,...

推荐理由:Hypercubic 这个 Hopper 把 TN3270 终端、z/OS 面板和 AI agent 揉在一起,让 agent 能直接操作大型机上的 COBOL 系统,敏感步骤还得人工点个头才放行。想法挺有意思,但正文没给出任何客户、定价或实际跑起来的效果数据,目前只是 Show HN 阶段的小团队产品展示。我会先打个折,等有真实案例再往上调。

TechCrunch · AI

Google 在 Android Show 上发了什么:AI 笔记本、能帮你干活的 Gemini、随口说说的桌面小部件

Google 在 I/O 大会前办了一场 Android Show,把 Gemini 助手塞进了更多地方。新发布的 Googlebooks 笔记本主打 AI 优先,但正文没披露具体配置、价格和上市时间。Gemini 变得更“代理化”,意思是它能跨 App 帮你完成一连串操作,不过实际效果还得看落地。Android 桌面小部件现在支持“vibe codi...

推荐理由:Google 在 I/O 前一口气甩出好几个 Gemini 相关的 Android 更新,我会先打个折:正文没给参数、没标价格、也没说什么时候能用上,所以只能当产品信号看。比较有意思的是 vibe-coded widgets,等于让用户用自然语言描述就能生成桌面小组件,门槛降得很低;Googlebooks 则像是把笔记和 Gemini 的搜索/总结能力缝在一起,能不能打还得看实际体验。整体属于有话题但缺验证的 mid-weight 产品更新。

The Verge · AI

Google 给 Gemini 加了几个新功能,核心是让它能直接操作你的安卓手机

Google 在安卓发布会前搞了个预演,推出了叫 Gemini Intelligence 的东西。简单说,就是把 Gemini 塞进安卓版 Chrome 浏览器里,能帮你自动填表,还能跨 App 执行操作。这离“手机自己用自己”又近了一步。不过正文没提哪些机型能用、什么时候推送、要不要另外付费,这些关键信息都还空着。

推荐理由:H、K、R 三条都成立。Gemini 开始接管 Android 上的 Chrome、自动填充和 app 内操作,不再是纯对话工具。我会先打个折:正文没披露支持设备清单、推送时间和定价,所以只能算产品更新,分数压在 72–77 这个区间。

TechCrunch · AI

Google 给安卓加了能跨 App 干活的 AI,还能用嘴说一个桌面小组件

Google 在安卓发布会上甩出了 Gemini Intelligence 这面新旗号,核心是让 AI 在手机里帮你跨 App 跑腿,比如填表、语音输入、上网查东西。比较有意思的是“vibe-coded widgets”——你直接用自然语言描述想要什么小组件,它就能给你生成出来,不用写代码。不过正文没提这些功能什么时候上线、哪些手机能用、收不收费,也没...

推荐理由:我会先打个折:正文只说了 Gboard 听写和表单填写这两个具体能力,发布时间、设备范围和价格全都没提,所以信息增量有限,不能给太高。但“agentic AI + vibe-coded widgets”这个说法本身挺抓人——一边是让模型进系统流程干活,一边是用自然语言随手生成小组件,对移动端 AI 入口的想象空间有拉动。这点先别太激动,毕竟没落地细节,但作为平台级更新,值得放进 featured 里让从业者扫一眼。

TechCrunch · AI

Anthropic 也下场了,给律所做了五类文书自动化工具

Anthropic 发布了一套面向律所的工具,覆盖文档检索与审阅、判例法资源查找、庭前证词准备、文书起草等五类事务性工作。文章没披露具体定价、上线时间和背后用的是哪个模型,也没给出实际律所的测试数据。我会先打个折——目前看更像是一个产品方向声明,能不能在合同审查这种容错率极低的场景里用,还得等更多验证。

推荐理由:Anthropic 这次不是发模型,是直接卖法律行业工具,把文档搜索、审查、判例调取、证词准备和起草这五件事串成一个产品。我会先打个折:正文没披露定价、客户数量和底层模型有没有专门为法律微调,所以现在还看不出是认真做行业方案还是先占个坑。但方向本身值得关注,因为法律文书工作量大、容错率低,能跑通一部分就能验证 AI 在专业服务里的付费意愿。这点先别太激动,等看到实际律所采用数据和准确率再说。

AI HOT 精选

Anthropic 在 Code w/ Claude SF 2026 上给开发者工具加码:Claude Code 调用频率翻倍,托管智能体新增记忆审查、多...

Anthropic 在旧金山的年度开发者大会上宣布了几项更新。Claude Code 的速率限制直接翻了一倍,Opus 模型的 API 调用上限也提高了,对重度用户来说不用那么频繁撞墙了。Claude 平台上的托管智能体(hosted agents)这次加了四个新功能:记忆审查,让智能体能回顾之前的对话;多智能体委派,可以把任务分给其他智能体去干;输出...

推荐理由:Anthropic 这次更新有具体数字和功能列表,不是画饼。速率翻倍对重度用户是实打实的改善,托管智能体加 4 项功能也说明他们在推 agent 落地。没有新模型发布,所以重要性在 78–84 这个区间合理。

5月12日星期二

AI HOT 精选

在 Claude Code 里装 OpenAI 官方 Codex 插件,让两个模型搭伙干活

作者在 Claude Code 的插件市场里加了 OpenAI 的官方库,把 Codex 插件装好、重载、配完就能用。这么做的思路来自 HeavySkill 论文的“重思考”方法:让多个模型各自独立推理,再找一个模型当主持人把思路揉到一起,提高最终回答质量。作者现在搭的 Skill 就是 Claude Code 负责推理,Codex 当主持人。正文没提...

推荐理由:HKR 三项都成立:跨模型插件调用有新闻性,安装路径可操作,对 AI 开发工作流有实际影响。但这是一篇教程型分享,不是模型或平台发布,所以只给 featured 低档。

AI HOT 精选

GitHub 员工用 Copilot CLI 把代码库变成了地牢探险游戏

一个 GitHub 工程师拿 Copilot CLI 做了个扩展,能把任意代码仓库解析成 Roguelike 风格的地牢地图。核心机制是程序化生成关卡——说白了就是让代码结构自动变成房间和走廊。这更像一个创意编程和游戏原型 demo,展示 Copilot CLI 除了敲命令,还能用来快速搭出带交互的终端小玩意。正文没披露生成一张地图要多久、支持多大的代...

推荐理由:HKR-H 和 HKR-K 都成立:GitHub 官方教程里藏了个新奇的 Demo,机制也讲清楚了。但它不是 Copilot 核心能力的大更新,正文没给性能指标、定价或基准数据,就是个教程级别的 featured,我会先打个折,别当重磅发布看。

Hacker News 首页

Statewright:用可视化状态机给 AI 智能体上把锁,让它干活更靠谱

这是一个刚在 Hacker News 上展示的开源项目,核心思路是用 Rust 写一个状态机引擎,把 Claude Code 能调哪些工具、能跑多少轮、怎么跳转、什么条件下才能执行下一步,全部用状态图管起来。作者说 130 亿到 200 亿参数的模型在真实的 SWE-bench 任务上表现都有稳定提升,但正文没披露具体的基准分数、样本量和评测流程,这点...

推荐理由:我会先打个折:SWE-bench 具体分数没披露,没法判断改进幅度有多大。但用状态机硬约束工具调用这个思路本身靠谱,尤其对 Claude Code 这类编程 agent 的稳定性有帮助。小模型能跑是个加分项,说明不是堆算力的玩法。整体值得推荐,但别把“一致改进”当成碾压性提升。

AI HOT 精选

想让 AI 当个人管家?先得把你在淘宝、京东、美团上的消费记录弄出来

作者实测了五个主流消费平台的数据导出方法。淘宝自带导出功能;京东没有官方支持,但作者用 Codex 写了个 Chrome 插件,能一键导出订单,代码已开源在 GitHub;饿了么可以申请导出 Excel;美团外卖目前完全没办法导出;大众点评的收藏列表也能通过定制插件导出来。作者把京东和大众点评的工具都开源了,目的是让用户拿这些消费数据喂给 AI Age...

推荐理由:这篇文章不是平台官方发布,是一个开发者的实操记录,所以重要性停在 featured 档。但 H、K、R 三项都踩中了:用订单数据喂 AI 助手这个切入点够抓人,5 个平台的具体导出方式是新事实,开源工具直接降低了数据可移植性的实现成本。我会先打个折——正文没披露导出数据的字段完整度和后续清洗工作量,这点先别太激动,但作为动手参考已经够用。

FT · 科技

亚马逊员工用内部 AI 工具刷分,把没必要的活也丢给 AI 干

FT 报道,亚马逊内部有个叫 MeshClaw 的工具,员工可以把工作委托给 AI 代理去完成,公司还搞了个 AI 使用排行榜。结果有员工为了冲榜,开始把一些根本不需要 AI 处理的活也丢进去跑。报道没披露具体有多少人这么干、排行榜的计分规则是什么,也没说这些“没必要的任务”到底是哪些。

推荐理由:FT 这篇报道给了一个亚马逊内部 AI 落地被玩坏的实例,HKR 三项都踩中了。正文没写参与人数、评分规则和任务类型,所以放在 featured 而不是必写。

量子位 · 公众号

OpenClaw 悄悄更新,Peekaboo v3 让龙虾在 Mac 上长出手脚

OpenClaw 的 Peekaboo v3 给 Mac 加了 agent 能力,能直接截取像素级屏幕、读取 UI 位置,然后模拟点击、打字、快捷键、滚动和拖拽。它还把 MCP 服务接进了 Cursor、Claude Code 和 Codex,等于让模型能进桌面软件里干活。正文没披露延迟和准确率数据,这点先别太激动。

推荐理由:OpenClaw 的 Peekaboo v3 给 Mac agent 加了一套完整的 GUI 感知和操作原语,还打通了 MCP,让 Cursor、Claude Code、Codex 都能调用。对搞桌面自动化的开源玩家来说是个实用更新,但毕竟只是一篇 Reddit 帖子,没有论文或代码仓库佐证,所以放在 featured 低段,78 分。

量子位 · 公众号

Anthropic 工程师提议用 HTML 替代 Markdown,Karpathy 也表态支持

Anthropic 工程师 Thariq 发了条推,列出 5 个理由主张模型输出 HTML 而不是 Markdown,Karpathy 随后转发表示认同。他的核心论点是 Markdown 的语法歧义太多,解析器各家实现不一致,模型生成时容易出错;HTML 虽然啰嗦但结构明确,对自动化处理和前端渲染更友好。正文没披露具体是哪 5 个理由,只提到生成 HT...

推荐理由:Anthropic 工程师 Thariq 主张用 HTML 替代 Markdown,Karpathy 也表态支持,这事在开发者圈子里容易吵起来。我会先打个折:这不是模型发布或产品更新,只是一场格式辩论。但文章给了具体数字——HTML 生成时间是 Markdown 的 2 到 4 倍,说明成本差距不小,从业者会关心 token 消耗和维护复杂度。正文没披露实验环境或代码,所以别太激动,目前只是一篇 Reddit 帖子,没有独立复现或论文支撑。