跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 161–180 条 · 共 760 条

5月26日星期二

AI HOT 精选

通义千问 Qwen3.7-Max 编程能力排到全球第二,Code Arena 得分 1541,仅次于 Claude

Qwen3.7-Max 在 Code Arena 编程评测上拿了 1541 分,排名第二,只比 Claude 低。官方说它能连续跑 35 小时的任务、单次调用工具超过 1000 次,原本要两周的项目几小时就能搞定。不过正文没披露具体测试环境、任务类型和对比模型的详细分数,实际生产表现还得看后续验证。

推荐理由:这条消息的钩子很清晰,就是“编程第二”这个位置。给出的分数和任务时长是硬指标,虽然都来自阿里云自己的一篇发布,没有第三方交叉验证,但作为产品更新和基准测试的成绩单,信息量够、指向明确。我会先打个折——没有独立评测之前,这个“第二”更多是厂商宣称,但它的确提供了一个可被检验的标靶,值得放进 featured 让从业者自己去盯后续实测。

机器之心 · 公众号

ACL 2026 论文:Spatial-Agent 让大模型不只是调地图 API,而是生成可执行的地理分析流程

这篇 ACL 2026 主会论文提出了 Spatial-Agent,核心思路是在用户用自然语言提问和调用地图工具之间,插入一张“地理流程关系图”(GeoFlow Graph),让大模型先规划出可执行的地理分析步骤,再一步步调用 API。在 MapEval-API 评测集上,搭配 GPT-4o-mini 的 Spatial-Agent 准确率达到 45....

推荐理由:ACL 主会论文,机制和数字都拿得出手,H 和 K 能过。但 GIS 工作流这件事本身圈子小,缺了成本、安全或平台竞争这些能出圈的点,R 就够不着,放在 featured 刚好。

新智元 · 公众号

昆仑万维发布天工 Agent,号称性能逼近 Opus 4.6,还给了 2-4 周免费试用

这篇文章本身被微信环境验证挡住了,正文内容没抓到。从标题和现有英文摘要看,昆仑万维发了两个模型:SkyClaw-v1.0 和 SkyClaw-v1.0-lite,主打 Agent 场景,也就是让模型进业务流程干活。他们宣称 SkyClaw-v1.0 的输入成本是 DeepSeek V4 Pro 的 1/24、Sonnet 4.6 的 1/43,这个数字...

推荐理由:这条消息我会先打个折,因为所有性能对比和成本数字都来自厂商自己,没有第三方验证。但它的传播点很清晰:一个国产 Agent 模型宣称能力接近 Claude Opus 4.6,同时把输入价格压到对手的四十分之一,还白送几周试用。对正在被 Token 账单压得喘不过气的团队来说,哪怕只是“声称”,也足够让人点进去看一眼。正文没披露这些基准测试的具体条件和评测机构,所以“逼近 Opus 4.6”先别太激动,但成本对比如果属实,确实挺省钱。

AI HOT 精选

OpenAI 被曝下月发 GPT-5.6,上下文窗口拉到 150 万 token

开发者在 OpenAI Codex 的后台日志里挖出了一个叫 iris-alpha 的未公开模型,对应 GPT-5.6,可能 6 月发布。最直观的变化是上下文窗口涨到 150 万 token,比现在 GPT-5.5 API 的 105 万多出约 43%。有人在辅助工具 OpenCode 里实测,喂到 90 万 token 还能流畅回话,甚至能处理超过 ...

推荐理由:这条消息来自 Codex 日志泄露,不是官方公告,所以我会先打个折。但 150 万 token 的上下文窗口和 iris-alpha 代号都是实打实的数字,对做 agent 和长文档处理的人有直接参考价值。正文没提发布时间和定价,这点先别太激动。整体属于值得从业者扫一眼的更新,但还没到必须立刻行动的程度。

AI HOT 精选

Grok Build 测试版上线,SuperGrok 用户能直接用它做图、剪视频和跑自动化脚本

xAI 把 Grok Build 的测试版开放给了所有 SuperGrok 和 X Premium+ 用户。这次主要给了三个东西:Plan Mode 可以分步骤拆解任务;Imagine 模块能直接生成图片和视频;还有一个命令行工具(CLI),方便你把 Grok 接进自动化流程或者编排器里干活。想试的话去 x.ai/cli 就能开始。

推荐理由:HKR 三项都踩中了:xAI 放出一个付费测试版,功能名目列得清楚。分数卡在 featured 底线,因为正文没写能力边界、没给定价、也没测试数据,我会先打个折——东西看着热闹,但能跑多稳、花多少钱,现在还不知道。

5月25日星期一

r/LocalLLaMA

NuExtract3 发布:一个 4B 开源视觉模型,能把图片和文字转成 Markdown、做 OCR 和按模板抽信息,自己电脑就能跑

Numind 放出了 NuExtract3,一个基于 Qwen3.5-4B 的开源视觉语言模型,用 Apache-2.0 协议。它主要干三件事:把图片或文字转成 Markdown 格式、从图片里直接识别文字(OCR)、以及按你给的 JSON 模板把非结构化内容抽成结构化数据。模型只有 4B 参数,对硬件要求不高,官方说最低 4GB 显存就能在本地部署。...

推荐理由:NuExtract3 把一个 4B 大小的开源视觉模型打包成了文档抽取工具,支持 OCR、转 Markdown 和按你给的 JSON 模板把内容抽出来。最吸引人的是它最低只要 4GB 显存就能在自己机器上跑,这对在意数据不出本地的团队来说省了不少事。模型基于 Qwen3.5-4B,用 Apache-2.0 协议,没有授权上的坑。不过正文没给出具体的抽取准确率或延迟数据,实际效果得自己测一下才知道。

r/LocalLLaMA

一个让 Codex 在无头 Linux 上安全折腾的沙盒框架

作者 superSmitty9999 放出了一个概念验证工具 ai-sandbox-manager,用 LXC 模板给 Codex 开了 sudo 权限、浏览器操作、Docker 和共享 GPU 访问,同时加了个钩子阻止 git push,让模型在隔离副本里干活,降低把系统搞崩的风险。正文没披露性能开销和具体延迟数据。

推荐理由:这是个 Reddit 上的个人概念验证,作者把 Codex 塞进 LXC 沙箱,给了 sudo、浏览器和 GPU,还加了防 push 的钩子。思路很实用,解决了“让模型干活又怕它闯祸”的矛盾,但正文没给任何性能数据、稳定性测试或实际跑任务的案例,目前只能当个有趣的工程方案看,离生产环境还有距离。

AI HOT 精选

Hugging Face 发了一篇术语辨析,把智能体的模型、脚手架和线束三层结构讲清楚了

这篇博客把智能体拆成了三层:模型(就是大语言模型本身)、脚手架(通过提示词和工具描述来定义模型的行为逻辑)和线束(负责实际跑模型调用、工具调用和控制循环的代码)。作者认为现在行业里这些词被混用得厉害,比如有人把整个智能体叫脚手架,有人把执行层叫线束,这篇就是想给个实用的参照,不是要定死标准。文章还顺带理了上下文工程、策略、技能、子智能体这些常被模糊使用...

推荐理由:Hugging Face 这篇把 agent 拆成三层:模型本身、Scaffolding(定义行为)和 Harness(管工具调用与控制循环)。这个分法解决了一个很实际的痛点——现在聊 agent 的人经常把“怎么调用工具”和“谁在控制循环”搅在一起,文章直接划了条线。我会先打个折:正文没给出具体的实现案例或性能对比,更像概念梳理,所以重要性停在 72 分。对正在搭 agent 架构的从业者来说,这篇能当一张参考图用,但别指望它直接告诉你代码怎么写。

5月24日星期日

r/LocalLLaMA

在 llama-server 网页里用原生工具做联网资料检索的实操分享

一位 Reddit 用户分享了怎么在 llama-server 自带的网页界面里,直接用 llama.cpp 的原生工具实现联网资料检索(也就是 web RAG)。他的做法分七步:先开启 get_datetime 和 exec_shell_command 这两个工具,然后让模型通过 firejail 沙箱、一个独立的 Linux 用户以及一个 Alpi...

推荐理由:这是一篇社区教程,不是模型发布或产品更新,所以权威性和覆盖面有限,但实操价值高。H、K、R 三项都成立:动手门槛低、步骤清晰、切中本地部署的痛点。我会先打个折,因为来源是个人帖子,验证强度弱,但信息量足够放进精选。

新智元 · 公众号

AI 第一次独立跑完芯片设计全流程:219 个英文单词进去,7nm 图纸出来,工程师全程没碰键盘

Verkor 的 Design Conductor 用一段 219 个英文单词的规格说明,在 12 小时内自动生成了 VerCore RISC-V CPU 的 ASAP7 7nm GDSII 版图,中间没有工程师介入。跑分结果是 1.48GHz 下 CoreMark 拿到 3261 分。不过先别太激动:这颗芯片还没实际流片验证,而且正文明确说没做缓存,...

推荐理由:我会先打个折:VerCore没流片、没缓存,现在只是跑分和版图层面的演示,离真能用还差验证和量产。但219词出GDSII这个点太直观了,12小时和1.48GHz也让效率对比有了抓手。正文没披露功耗、面积和设计规则检查结果,这些缺口让“独自跑完”的说法要打问号。不过作为自动化流程的阶段性成果,数字够硬、场景够刺激,给79分合理。

r/LocalLLaMA

llama.cpp 服务器现在自带 8 个原生工具,不用再拼 MCP 就能让本地模型直接读文件、搜代码、跑命令

llama.cpp 的 server 端多了一个实验性的 --tools 参数,一口气给了 8 个内置工具:read_file、file_glob_search、grep_search、exec_shell_command、write_file、edit_file、apply_diff 和 get_datetime。说白了,就是让跑在本地的模型能直接读...

推荐理由:我会先打个折,因为还是实验性功能,而且来源主要是 Reddit 讨论,不是官方安全公告。但这事本身挺炸:llama.cpp 服务端直接塞进 exec_shell 和 edit_file,等于给模型开了系统级后门,正文又明说没有白名单和严格沙箱。对在本地跑 agent 的开发者来说,这不是“未来可能的风险”,是现在就得小心配置的东西。所以给了 featured 里偏低的分数,提醒大家注意,但不过度渲染。

5月23日星期六

AI HOT 精选

Claude Code v2.1.149:用量报告分类展示、企业可开放云端 MCP 连接器,并修了三个安全漏洞

这个版本主要做了三件事。第一,/usage 命令现在会按类别(比如对话轮次、工具调用)分开展示用量,方便你看出成本花在哪。第二,企业管理员可以通过 allowAllClaudeAiMcps 设置,允许团队直接使用 Anthropic 云端的 MCP 连接器,不用自己搭。第三,修了三个安全漏洞:PowerShell 脚本可能绕过权限执行、Git work...

推荐理由:Claude Code 的一次小版本更新,改动不多但都落在实处。/usage 现在能按类别看用量,方便你盯成本;企业管理员多了个 allowAllClaudeAiMcps 开关,可以统一放行 MCP 工具,不用一个个批。安全方面修了 3 个问题,最要紧的是 PowerShell 权限绕过——正文没展开具体利用条件,但光这个就够让运维团队推更新了。整体属于实用型发版,没画饼。

AI HOT 精选

Claude 自动模式向 Pro 用户开放,支持 Sonnet 4.6 和 Opus 4.7

Claude 的自动模式现在 Pro 计划也能用了,不再是最贵那一档的专属。这次更新还接入了 Sonnet 4.6 和 Opus 4.7 两个模型,按 Shift+Tab 就能让 Claude 自己跑任务。正文没提价格有没有变,也没说是不是全量推送,这点先别太激动。

推荐理由:这是一次中等体量的产品更新,不是新模型或重大能力发布。自动模式进 Pro 计划,配上两个模型和快捷键,对日常靠 Claude 干活的开发者有实际影响,但还没到需要全行业关注的程度。

r/LocalLLaMA

Agent 里的调度模型能做多小?有人用 3B 激活参数的 MoE 跑通了本地 ReAct 循环

这篇帖子来自一个叫 HomoAgens1 的本地部署实验,他把 Agent 的调度模型和写代码的大模型拆开看,专门测调度环节能缩到多小。他用的 Qwen3.6-35B-A3B 是个 MoE 模型,实际干活时只激活约 3B 参数,跑在一块 12GB 显存的 GPU 上,关了 30 个专家做 offload,生成速度能到每秒 40 个 token。实验发现...

推荐理由:我会先打个折:这是 Reddit 上的单人实验,不是正式发布,结论别当定论。但它的发现很实在——用 Qwen3.6-35B-A3B 跑 ReAct 编排,3B 激活参数就能在 12GB 显卡上跑到 40 t/s,成本够低。更小的模型不是推理先崩,而是工具调用纪律先坏,这个失败模式对选型很有参考价值。显存、速度和故障点都给了具体数字,对想在家用显卡上折腾 agent 的人是一手好参考。

AI HOT 精选

Kakuna:把原型代码自动加固成生产级项目的 AI 工具

Kakuna 是一个 AI 代理工具,专门把早期快速原型转成可维护的生产级代码库。它内置检查清单和“先定计划再执行”的工作流,模拟人类开发与运维的流程,在不动功能的前提下自动做代码审查、补测试、重构这些“无聊活”。工具强调用多个子代理并行干活来提效,一次大约 16 小时的运行能生成上百次提交,把一个脆弱的 MVP 变成结构清晰、能长期迭代的稳定项目。正...

推荐理由:Kakuna 这个工具让代理按内置检查清单和“计划-目标”流程自动加固代码,一次约16小时能跑出上百次提交。我会先打个折——单条推文来源、非大厂出品,验证强度有限,但信息量够:工作流机制、运行时长、产出规模都给了具体数字,不是画饼。对正在折腾原型转生产的开发者来说,这种“代理帮你擦屁股”的思路有参考价值,所以放在 featured 档。

AI HOT 精选

谷歌在 I/O 大会甩出一整套 AI 代理开发工具,从写代码到上线调试全包了

谷歌这次发布的不是单个模型,而是一条让 AI 代理(能自主干活的程序)落地的工具链。Antigravity 2.0 是个独立桌面应用,配了命令行工具和 SDK,方便开发者直接在本机跑代理。Google AI Studio 新增 Kotlin 支持,号称能一键生成安卓应用并发布,还出了手机版 App。Gemini API 里加了托管代理服务,部署步骤简化...

推荐理由:HKR 三项都成立:谷歌端出了一套有名字、有组件的代理工具栈,覆盖本地开发、云端托管和浏览器协议。不过目前只有社交媒体的摘要,正文没披露定价、API 细节和实际演示,所以分数卡在 78–84 这个区间。我会先打个折,等看到更完整的文档再往上调。

r/LocalLLaMA

llama.cpp 新分支让 MoE 模型在 12GB 显存上跑得更快,RTX 2060 上速度从 19/22 tk/s 提到 26 tk/s

comanderxv 给 llama.cpp 开了个叫“experts first”的分支,专门优化混合专家模型(MoE)的显存调度。做法是把常用的专家模块提前缓存到显存里,实测用 RTX 2060(12GB 显存)跑 Qwen3.6-35B-A3B 模型,专家缓存命中率约 62%,生成速度从原来的 19 或 22 token/秒提升到了 26 tok...

推荐理由:HKR 三项都踩中了:钩子是一块 12GB 的老卡把 35B MoE 速度拉上来一截,有缓存机制和命中率数据撑着,话题又打在本地推理的成本神经上。不过这事目前还局限在本地推理的小圈子,所以放在 featured 档刚好,不用拔到必读。

5月22日星期五

Hacker News 首页

Superset:一个能同时派多个 AI 编程助手干活的开源编辑器

Superset 把自己定位成“AI 代理时代的代码编辑器”,核心卖点是能在一台机器上并行跑 Claude Code、Codex、OpenCode 等多个编程助手,通过 git worktree 让它们互不干扰地改代码。团队还放出了 Remote Workspaces 的测试版,可以在远程机器上跑这些助手,再从桌面应用里统一管理。项目在 GitHub ...

推荐理由:HKR 三项都踩中了,但这是 YC 新项目的首发帖,正文没给用量、定价和性能对比。git-worktree 并行 agent 这个工作流设计够上 featured,但离必写还差实际验证数据。

Mistral AI

Mistral 在 Studio 发布 Connectors,支持内置与自定义 MCP

Mistral 在 Studio 发布 Connectors,所有内置连接器和自定义 MCP 现可通过 API/SDK 用于全部模型与智能体调用。新功能包括直接工具调用、human-in-the-loop 审批流程,以及对连接器的创建、修改、列出和删除等编程访问。

推荐理由:原文给出 Connectors 的 API 用法与代码示例,读者可据此判断企业级 MCP 集成如何落地。

AI HOT 精选

Karpathy 用 65 行规则文件把 AI 编程准确率从 65% 拉到 94%

Karpathy 在 GitHub 上发了一个叫 CLAUDE.md 的规则文件,65 行、4 条规则,让 AI 编程准确率从 65% 跳到 94%。核心思路是逼开发者先想清楚再动手:深度思考、代码越短越好、只改该改的地方、每一步都盯着目标走。文件已经拿了超 22 万星标,但正文没披露 94% 这个数字是在什么任务、什么模型上测出来的,也没说对比基线是...

推荐理由:这篇我会先打个折,因为正文只给了总结性的数字,没披露具体是哪 4 条规则、在什么任务集上测的、评测方法是什么。但 Karpathy 这个名字加上 94% 这个数字,对用 Claude Code 干活的人来说,诱惑力足够大。22 万星标也说明社区在追这个方向。所以虽然信息有缺口,还是值得推给读者看一眼,只是别把 94% 当成普适结论。