跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 621–640 条 · 共 760 条

4月4日星期六

X · @dotey(宝玉)

Mintlify 给 AI 文档助手造了个假文件系统,启动从 46 秒降到 100 毫秒

Mintlify 把 AI 文档助手的检索方式从向量 RAG 换成了 ChromaFs——一套用数据库查询模拟 grep、cat、ls 的假文件系统。AI 以为自己在一个真实的文件系统里翻文档,实际上每个命令都被拦截翻译成 Chroma 查询。效果是会话启动时间从沙箱方案的 46 秒压到 100 毫秒,每次对话的边际计算成本几乎为零。按他们月均 85 ...

推荐理由:Mintlify 这篇工程博客写得很实在,没有吹概念,而是把方案和取舍摊开来讲。核心思路是把文档页映射成“文件”、章节映射成“目录”,让模型用熟悉的命令行工具去探索,背后实际是数据库查询。效果很直观:启动时间从 46 秒砍到 100 毫秒,边际计算成本接近零。我会先打个折——这个方案强依赖文档本身有清晰的层级结构,正文也承认不适合无层级知识库,所以别把它当成万能 RAG 替代品。但它的真正价值不在省钱,而在检索范式的切换:不是把资料塞给模型,而是让模型自己动手翻。这点对正在折腾 agent 检索链路的人,比单纯跑分更有启发。

4月3日星期五

X · @claudeai

Claude 全系套餐都能直连微软办公三件套了

Anthropic 把 Microsoft 365 连接器开放给了所有 Claude 付费套餐,不再只限高价版本。你可以把 Outlook 邮件、OneDrive 文档和 SharePoint 文件直接拽进对话里,让 Claude 帮你翻邮件、总结文档或从公司资料库里找东西。帖子确认了覆盖范围和对接的应用,但没提权限边界怎么划、管理员要不要额外配置、有...

推荐理由:这是一条中等体量的 Claude 产品更新:Anthropic 把 Microsoft 365 连接器铺到所有方案,改变了 Outlook、OneDrive 和 SharePoint 的实际接入范围。HKR 三项都踩中,但正文没披露价格、权限边界、地区限制和管理后台条件,所以只能放在 featured 低段。我会先打个折——全量放开比加新功能更值得盯,但缺的信息让人没法判断企业能不能直接推。

X · @op7418(歸藏)

Karpathy 用 Obsidian 和大模型搭了一套本地知识库,把原始资料自动整理成可提问、可写报告的 Wiki

Karpathy 的做法是把原始资料扔进一个叫 RAW 的文件夹,让大模型自动生成摘要、索引、概念页、相互链接和可视化图表,最终形成一个本地 Markdown Wiki。之后可以直接在这个 Wiki 上提问,模型会查索引、读相关文档再给出回答或生成新文件、网页甚至 PPT,并把输出存回知识库。他特别提到 AI 生成的内容会污染语料,要把可信来源和 AI...

推荐理由:HKR-H 和 HKR-R 都站得住,因为 Karpathy 这种级别的从业者公开自己的本地 Wiki 工作流,本身就自带讨论度,而且他点出的“AI 生成内容会污染库,最好跟可靠来源分开”是个很实际的痛点。HKR-K 靠的是 RAW→LLM→摘要/索引/互链这条具体管线,但正文没披露用了什么模型、资料规模多大、自动化脚本怎么写,所以知识增量卡在中等偏上,分数停在 76 合理。

X · @op7418(歸藏)

谷歌发布 Gemma 4,四个尺寸全 Apache 2.0 开源,主打本地跑 agent 和多模态

Gemma 4 一口气发了四个版本:E2B 给手机和 IoT 用,E4B 给移动端和 Jetson/树莓派,26B MoE 每次只激活 3.8B 参数、延迟低吞吐高,31B 全密集版适合桌面或单卡 H100。这次把 agent 工作流当第一优先级,原生支持函数调用、JSON 输出和系统指令,还直接能处理图像、视频和语音转文本,可以做本地语音助手。全部用...

推荐理由:谷歌发 Gemma 4 是一次有分量的开源模型更新。HKR 三项都成立:26B MoE 只激活 3.8B 的部署弹性够抓人,四个规格和商用许可给了新事实,成本敏感场景的参考价值也明确。分数定在 81 是因为基准、上下文窗口和测试细节都没披露,我会先打个折,这点先别太激动。

X · @claudeai

Claude 的电脑操控功能 Cowork 和 Code Desktop 现在支持 Windows 了

Claude 把电脑操控能力带到了 Windows 上,覆盖 Cowork 和 Code Desktop 两个入口。正文只发了一句话和一条链接,没提支持哪些 Windows 版本、权限怎么管、操作延迟多少、要不要额外付费,也没说什么时候正式推送。对想在 Windows 上跑桌面 agent 的人来说,现在只能知道功能有了,但稳定性和实际跑起来怎么样,这...

推荐理由:Claude 把 computer use 能力从非 Windows 平台扩到了 Windows,标题就这一句事实。正文没披露支持哪些 Windows 版本、权限怎么隔离、操作延迟多少、要不要加钱、什么时候正式上线,这些才是决定能不能在生产环境用的关键。我会先打个折:桌面代理在 Windows 上的稳定性边界还没给可复现条件,别急着全量上。分数维持 74,因为这是官方更新,但信息密度只够确认可用性,离评估还差一截。

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

4月1日星期三

MIT Technology Review · AI

在家训练人形机器人的零工:尼日利亚医学生头顶 iPhone 拍做家务

Micro1 这家公司雇了 50 多个国家的几千名零工,让他们把 iPhone 绑在头上,拍自己叠被子、洗碗、做饭的视频,再把这些真实动作数据卖给做人形机器人的公司。一个尼日利亚的医学生时薪 15 美元,在当地算高收入,但他觉得每天重复熨衣服很无聊。文章说 2025 年人形机器人拿到的投资超过 60 亿美元,机器人公司每年花在买这类数据上的钱超过 1 ...

推荐理由:这篇我会放进 featured。在家拍家务视频这个画面本身就够抓人,而且文章给出了规模、薪酬和支出的具体数字,不是空谈。更值得盯的是它把一条隐藏的数据管线摊开了:工人知道视频是给机器人训练用的,但正文没披露这些数据怎么存、跟谁共享、能不能删。这种治理上的模糊,比融资数字更说明行业现在还处在野蛮生长阶段。

3月24日星期二

Lex Fridman 播客

黄仁勋对谈 Lex Fridman:英伟达如何从单卡竞争转向整机柜、整数据中心的极端协同设计

黄仁勋在播客里解释了英伟达现在为什么要搞“极端协同设计”——因为单颗 GPU 已经不够用了。你想让一万台计算机跑出百万倍的加速,就不能只堆硬件,得把算法拆开、把模型和数据切碎(分片),让网络、交换、存储、供电、散热全部配合起来。否则受制于阿姆达尔定律,计算部分再快,整体也只快一点点。他还提到自己直接管 60 多个人,几乎全是工程背景,分别盯着内存、CP...

推荐理由:这是一手访谈,黄仁勋把 NVIDIA 的竞争逻辑讲得很清楚:不再拼单卡,而是拼整机柜甚至数据中心的协同设计。他提到 60 多个直接下属、1 万台计算机的扩展目标,以及 Amdahl 定律带来的实际限制,信息密度高。我会先打个折,因为这是播客分析,不是新产品发布或人事变动,但作为理解 NVIDIA 战略的入口,值得从业者花时间看。

3月20日星期五

MIT Technology Review · AI

OpenAI 要造一个全自动 AI 研究员,先别急着喊“科学家要失业”

OpenAI 把“造一个全自动 AI 研究员”定成了接下来几年的北极星目标。首席科学家 Jakub Pachocki 跟 MIT Technology Review 聊了分两步走的计划:今年 9 月先搞一个“AI 研究实习生”,能独立啃一小批特定研究问题;2028 年再上完整的多智能体自动化系统。但正文没披露这个系统要怎么评估产出靠不靠谱、打算烧多少算...

推荐理由:HKR-H 落在“全自动研究员”这个具体到能让人立刻理解野心的钩子上,HKR-K 靠两个可验证的时间节点撑住信息量,HKR-R 则抓住了研究岗位替代和实验室军备竞赛这两条从业者最关心的线。没给 must-write 是因为正文没披露评测标准、算力预算和研究范围,目前只能算一个强路线信号,离可验证产出还有距离。

3月19日星期四

Ben's Bites

怎么写一份不帮倒忙的 AGENTS.md?

AGENTS.md 是给 AI 助手预载的指令文件,但别把它写成项目地图。有研究指出,塞进技术栈、关键文件路径这类信息反而会拉低表现,还让 token 消耗多出 20%——这些东西模型自己翻翻代码就能搞清楚。更好的做法是只保留你的行为偏好和纠偏提示,比如“生成网页前先用内置浏览器测一下再给我链接”、“把计划文件统一写到 ~/项目名/plan/ 里”。文...

推荐理由:这篇讲的是怎么把 AGENTS.md 写小、写干净。核心判断很明确:别往里面塞技术栈和文件地图,只保留行为偏好,否则效果会变差,成本还能多出 20%。这个 20% 的数字来自一项研究,但正文没披露研究名称和实验设置,所以我会先打个折来看。可执行的部分挺实在,比如把 AGENTS.md 和 CLAUDE.md 做 symlink、用条件块区分简单网页和复杂应用、按文件夹动态加载,都是能直接抄作业的做法。对经常跟 coding agent 打交道的人来说,这比“多写点上下文”的直觉有用得多,本质是把常驻指令压到最小,减少每次调用的无效消耗。信息缺口在于...

硅谷101 播客

Web3 101串台|“龙虾热”背后,如何防范OpenClaw系统级风险

这期播客请了安全专家余弦和“龙虾”老玩家知县,把OpenClaw的风险拆成了几个层级:刚装上时,Agent能读你当前用户能看的本地文件;开始聊天后,对话内容会传到模型服务器,别发密钥密码;让它读写文件干活时,大模型可能理解错意思,误删误改文件,最常见的是把自己“改死”;操作浏览器时,你已登录的账号信息它都能拿到,访问恶意链接也会中招;安装Skill或软...

推荐理由:HKR 三项都踩中了:用具体机制讲一个热门 agent 的系统风险,不是抽象恐吓。文章引了约 250 条安全公告和 v3.2 默认限制,但本质还是播客评论,不是一手产品发布或研究,所以分数落在低段。

3月17日星期二

OpenAI News

OpenAI 发了 GPT-5.4 mini 和 nano,主打编程和子任务,mini 跑得比 GPT-5 mini 快一倍多

OpenAI 在 3 月 17 号推出了 GPT-5.4 mini 和 nano,都是给高吞吐、低延迟场景用的轻量模型。mini 在编程、推理、看图、调工具上都比上一代 GPT-5 mini 强,速度还快了一倍多。跑分上,mini 在 SWE-Bench Pro 拿到 54.4%,跟大哥 GPT-5.4 的 57.7% 差距不大,但延迟低很多,适合需要...

推荐理由:这是 OpenAI 官方模型发布,不是小修小补。我会先打个折:虽然叫 GPT-5.4 mini,但别当它是 GPT-5.4 的完整缩小版,更像是一个专攻编码和子代理任务的轻量选手。真正值得盯的是它用更低价格和更快速度,把 SWE-Bench Pro 拉到 54.4%,离大模型只差 3.3 个百分点——这点先别太激动,正文没披露其他基准的对比,不知道通用能力缩水多少。nano 更极端,只走 API,价格压到输入 0.20 美元,明显是给大批量、简单任务准备的。整体看,OpenAI 在推‘够用且便宜’的代理专用模型,对频繁调用代码工具的场景挺省钱。

MIT Technology Review · AI

OpenAI 的技术可能出现在伊朗冲突的哪些环节

OpenAI 跟五角大楼签了涉密协议刚过两周,MIT Technology Review 就划出了三个可能用到它家技术的场景。一是目标排序:分析师把潜在目标清单丢给模型,让它结合后勤、情报等数据排出优先打击顺序,但正文没解释人工复核到底怎么提速。二是反无人机分析:OpenAI 之前跟 Anduril 合作,用模型做实时威胁识别和拦截建议,不过两家都没更...

推荐理由:MIT Technology Review 把 OpenAI 的涉密国防合作往伊朗冲突上套,列出目标排序、反无人机分析和行政支持三个可能落点。我会先打个折:文章没给出部署时间表,也没实锤任何战场使用,所以判断要收着点。但选题本身踩在军事 AI 的敏感线上,加上 OpenAI 刚进涉密圈,这个时间点发出来,话题性够强。

3月16日星期一

MIT Technology Review · AI

AI 智能体刚学会跑,企业的管理手段还没跟上

2025年底到2026年初,无代码工具和开源个人助手 OpenClaw 出现,让生成式 AI 从爬直接变成了跑。加州 AB 316 法案在 2026 年 1 月 1 日生效,企业不能再把责任推给 AI 说“是它干的,我没批准”。IDC 受 Data Robot 委托的调查显示,96% 的生成式 AI 部署和 92% 的智能体部署都超了预算。真正的麻烦在...

推荐理由:这篇不是产品发布,而是用数据说话的评论。AB 316 把法律责任钉死了,IDC 和 Data Robot 的调查又说明成本失控是普遍现象,不是个案。文章没画大饼,反而把治理跟不上自治速度的风险摊开讲,对正在落地 agent 的团队有直接参考价值。

3月11日星期三

MIT Technology Review · AI

中国 OpenClaw 热潮催生了一门帮人装“龙虾”的生意

北京工程师 Feng Qingyang 一月份开始帮人安装 OpenClaw(一个能接管设备自主干活的开源 AI 工具),到二月底辞职,现在团队超过 100 人,已经接了 7000 单,每单约 248 元人民币。淘宝和京东上现在有几百个相关商品,价格从 100 到 700 元不等。这波热潮的核心不是技术本身,而是安装门槛高、数据隔离有风险,把开源工具变...

推荐理由:这篇不是产品发布稿,是扎实的现场观察。一个副业变百人团队的故事有传播力,市场定价和订单量给了硬数字,数据隔离风险又让行业里的人不得不重视。我会先打个折:正文没披露团队构成和 7000 单的统计口径,但整体信息密度够高,值得放在精选位。

OpenAI News

OpenAI 给 Responses API 加了个电脑环境,让模型能自己敲命令行干活

OpenAI 在 2026 年 3 月 11 日说,他们的 Responses API 现在能调用一个 shell 工具,在托管的隔离容器里执行命令。模型(GPT-5.2 及之后版本)会自己提议该敲什么命令,API 负责在后台跑、把结果流式传回来,还能同时开多个会话并行处理。容器里带了文件系统、可选的 SQLite 和受限的网络访问。这相当于给模型配了...

推荐理由:这次更新把 Responses API 从“调工具”升级成“给模型一台隔离电脑”,shell 执行、流式输出、并行跑命令、上下文压缩都实装了,对 agent 开发者是实打实的新能力。正文后半段截断,定价、配额和完整安全边界都没写,所以实际落地成本和安全兜底还得等后续披露。

3月10日星期二

NVIDIA 博客

NVIDIA 和 Thinking Machines Lab 签了份长期大单,起步就是 1 吉瓦的算力

NVIDIA 和 Thinking Machines Lab 宣布了一项多年合作,核心是部署至少 1 吉瓦的 NVIDIA Vera Rubin 系统,目标明年年初上线,用来训练前沿模型和搭建可定制的 AI 平台。1 吉瓦这个数字很夸张,相当于一个大型核电站的发电量,说明这不是普通的云服务采购,而是直接锁定了一整座“算力电厂”的产能。合作还涉及基于 N...

推荐理由:1 吉瓦 Vera Rubin 承诺把这条合作从普通公关稿里拎了出来:H 靠规模,K 靠具名系统和部署时间,R 靠前沿算力竞争。没给 P1 是因为来源是厂商博客,投资金额、算力归属、分阶段细节正文都没披露,我会先打个折。

OpenAI News

ChatGPT 上线数学和科学互动图解,覆盖 70 多个核心概念

OpenAI 给 ChatGPT 加了一个学习功能:问勾股定理、理想气体方程这类问题时,它会直接弹出一个可拖拽的图表模块。你可以手动调参数、改公式,图表会跟着实时变,把抽象公式变成能上手试的东西。首批覆盖 70 多个数学和科学概念,所有付费和免费用户都能用。官方说每周有 1.4 亿人用 ChatGPT 学数学和科学,但正文没披露这个互动功能背后的模型、...

推荐理由:我会先打个折:这是个中等体量的产品更新,不是模型能力突破。钩子在于把抽象概念变成能动手玩的画面,对教学场景有直接吸引力。1.4 亿周活和 70+ 概念是实打实的数字,说明铺量已经很大。但正文完全没提模型怎么支撑这些交互、有没有做过学习效果验证,这点先别太激动。整体判断是产品化动作值得关注,技术深度和效果证据还缺位。

3月9日星期一

MIT Technology Review · AI

AI 正把伊朗冲突变成一场实时观战秀

作者一周内看了十几个伊朗战争仪表盘,它们把卫星图、船舶追踪、AI 摘要和赌盘链接拼在一起,把战争变成了可以边吃爆米花边看的实时界面。一个由 a16z 员工搭建的仪表盘直接接入了 Kalshi 的下注数据,而调查记者 Craig Silverman 已经记录了 20 个类似的工具。问题出在信息质量上:英国《金融时报》报道过 AI 生成的虚假卫星图正在网上...

推荐理由:我会先打个折:这不是产品发布或模型突破,而是一篇有事实支撑的评论。H 靠战争面板加博彩这个钩子立住了,K 靠具体案例和数字撑起来,R 打中了从业者对 AI 信息质量和伦理的敏感神经。文章没给解决方案,但把问题摆得很清楚,所以放在 featured 合适。

OpenAI News

OpenAI 宣布收购 Promptfoo,要把安全测试直接做进 Frontier 平台

OpenAI 发公告说要收购做 AI 安全测试的 Promptfoo,交易完成后会把它的技术整合到企业级平台 Frontier 里。Promptfoo 的工具现在有超过四分之一的财富 500 强公司在用,主要帮开发者在模型上线前做安全评估和红队测试,比如检测提示词注入、越狱、数据泄露、工具滥用这些风险。收购后,OpenAI 打算把自动化安全测试、红队演...

推荐理由:这条消息我会先打个折,因为收购价格和时间表正文都没写,没法判断交易规模和落地节奏。但 OpenAI 把一家已有大客户基础的评测工具直接收进 Frontier,对做 agent 的团队来说是个强信号——以后安全测试和红队评估可能变成平台自带能力,不用再外挂工具。这点先别太激动,等更多细节出来再看。