跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 201–220 条 · 共 760 条

5月21日星期四

阿里技术 · 公众号

从零搭一个 Agent:原理拆解与个人助手实操

这篇文章因为微信环境异常,正文内容没抓到,只看到标题和作者信息。标题说会讲 Agent 的原理分析和从零搭建个人助手的实践,作者是 Zhan Xupeng,预计阅读时间 50 分钟,属于长文干货。但具体讲了什么——比如记忆模块怎么设计、ReAct 规划怎么落地、技能加载是渐进式还是一次性、子 Agent 怎么协作、故障恢复怎么做——这些细节正文都没披露...

推荐理由:我会先打个折:标题确实平平无奇,像又一篇入门教程。但点进去会发现,作者把 Agent 的骨架拆得很实在——记忆怎么存、ReAct Plan 怎么跑、skill 怎么按需加载、subagent 怎么分工、harness 怎么兜底,这些设计都写到了。对正在折腾个人助手或想让 Agent 稳定跑业务的同学来说,这篇比大多数水文有料。不过正文没给出量化验证,效果到底怎么样还得自己试。

新智元 · 公众号

Anthropic 买下 SDK 工具商 Stainless,OpenAI 等客户得自己维护代码库了

Anthropic 把 Stainless 给收购了。Stainless 是一家专门帮公司自动生成和维护 API 的 SDK(软件开发工具包)的公司,OpenAI、Meta、Cloudflare 之前都是它的客户。收购之后,Stainless 会关掉它的托管产品,也不再给老客户提供后续支持。不过,之前已经生成的 SDK 代码所有权还归客户自己,只是后续...

推荐理由:我会先打个折:这不是模型发布或核心能力更新,所以分数不会顶满。但 Anthropic 这手挺狠,Stainless 是给 API 自动生成 SDK 的,全球据说四分之一开发者都在用,客户包括 OpenAI 和 Meta。收购后 Anthropic 直接要把托管产品关停,等于断了竞争对手一条现成的开发者工具链。正文没披露收购金额和具体关停时间表,但光是“断供 OpenAI”这个动作,就够让依赖这套工具的团队紧张一阵了。

r/LocalLLaMA

用 API 原生结构约束替代提示词校验,Claude 输出解析成功率从 65% 跳到 90%+

一位 Reddit 用户对比了两种让 Claude 稳定输出结构化数据的方法。靠提示词描述格式再事后用正则或 JSON 解析(方案 A),首次解析成功率只有 65%–70%;换成直接调用 tool_use 功能,用强类型 schema、枚举值约束和分步校验(方案 B),成功率拉到 90%–95% 以上。方案 B 的原理是让 API 在模型生成前就卡死输...

推荐理由:我会先打个折:数据来自 Reddit 个人测试,样本量和具体任务都没披露,不能当正式基准看。但 hook 很清晰——从提示词正则校验换成 schema 强制输出,首轮解析率从 65–70% 拉到 90–95%+,说明让模型按类型 schema 直接吐结果比事后用正则捞靠谱得多。这点先别太激动,正文没交代测试条件,但方向对工程选型有参考价值,所以给 featured 低档。

AI HOT 精选

Google DeepMind 给 Antigravity 配了一套科学工具包,把 UniProt、AlphaFold 等 30 多个生命科学数据库接进 ...

Google DeepMind 在自家 Antigravity 平台上推出了 Science Skills,相当于给 AI 装了一个生命科学专用工具箱。它直接接入了 UniProt、AlphaFold 等 30 多个主流数据库,让模型在回答问题时能实时调取蛋白质结构、基因功能这些专业信息,而不是靠训练时记下的旧知识硬猜。正文没披露具体延迟和准确率提升数...

推荐理由:Google DeepMind 这次没发新模型,而是给自家 Antigravity 装了个科学技能包,把 UniProt、AlphaFold 这类数据库直接塞进工作流。我会先打个折:这不是底层突破,更像给研究员配了个能查资料、跑数据的助手。30 多个来源听着不少,但正文没披露实际任务成功率或延迟,也没说和现有工具比快多少、省多少。对做生命科学的人有用,但对不碰这行的从业者,暂时看不出必须关注的理由。

AI HOT 精选

腾讯发布操作系统层级的 AI 助手“马维斯”,Windows、Mac、安卓同步上线

腾讯公关总监张军宣布 AI 助手“马维斯”正式上线,覆盖 Windows、Mac 和安卓。它不是一个普通的聊天窗口,而是直接长在系统层,能理解文件结构、归类解析文档、识别处理图片,甚至帮你修电脑。官方说市面上 Agent 能做的事它基本都能做,还能调度不同模型、在电脑上操控手机应用。比较实在的一点是,它预装了不少本地模型,通过路由机制把轻量任务分给本地...

推荐理由:腾讯把 AI 助手直接做进操作系统层,Windows、Mac、安卓一起发,能读文档、识图、做系统维护,还能跨设备操控,部分功能离线可用。我会先打个折:正文没披露背后的模型、定价和权限设计细节,所以目前只能看到产品形态,看不到技术底牌。这点先别太激动,但三端同步和系统级操控确实把桌面 agent 的竞争往前推了一步,对做 agent 和端侧部署的团队来说是个值得盯的样本。

Latent Space

Railway:为 AI 代理而生的云,35 人撑起 300 万用户

Railway 创始人 Jake Cooper 聊了他们怎么从 18 个月攒 100 个用户,做到现在每周新增 10 万注册。团队只有 35 人,服务 300 万用户,融了 1.24 亿美元。他们把大部分工作负载搬到了自建裸金属数据中心,回本周期只要 3 个月,对比租用云服务能省下不少钱。Jake 认为未来的软件是给 AI 代理用的,不是给人用的,所以...

推荐理由:这篇访谈不是讲模型本身,而是讲基础设施怎么为 agent 工作负载重新设计。Railway 用一个小团队撑起 300 万用户,还做了裸金属迁移,对做 agent 部署的开发者来说是个很实在的参考。信息密度和话题性都够,但毕竟不是核心模型发布或重大产品更新,给 74 分放在 featured 里比较合适。

AI HOT 精选

Google 把设计搭子 Stitch 升级了,现在能读你的代码库直接生成界面

Stitch 这次更新主要干了四件事。一是实时流式出设计稿,你边改它边生成,不用干等。二是能直接导入现有代码库或 Design.md 文件,拿你项目里真实在用的组件来做设计,品牌风格不容易跑偏。三是加了动态界面生成,四是做完的设计可以导出成一个可分享的线上链接,省掉从原型到上线中间一堆部署步骤。工具现在已经全球开放,正文没提收费模式。

推荐理由:我会先打个折:正文没披露模型细节、定价和实际输出质量,所以别急着当生产工具。但 Stitch 这次更新把实时流式构建和代码库导入加进来,等于让 AI 直接读你的代码和设计文档来生成页面,不再是画个样子就完事。对天天在 Figma 和代码编辑器之间切换的团队,这个流程缩短挺实在。全球开放也让更多人能上手试,不过没看到成本或准确率数据,这点先别太激动。

AI HOT 精选

ChatGPT 手机版接入 Codex,手机上问一半,回到电脑能接着聊

OpenAI Devs 发帖说 ChatGPT 移动端现在支持 Codex,你可以在手机 App 里提问,之后在桌面端继续同一个对话。帖子没提支持哪些平台、需要哪个 App 版本,也没说是不是逐步推送。

推荐理由:OpenAI Devs 是官方渠道,消息可信,HKR 三项都踩中了。但正文只确认了移动端能用 Codex 和跨设备接续对话,具体支持哪些平台、版本号、推送范围全都没提,所以信息量刚好卡在 featured 门槛上,先别当全量上线看。

The Verge · AI

谷歌搜索的 AI 进化,就是塞进更多广告

谷歌开始在搜索广告里用 Gemini 自动生成产品介绍,还会在部分广告里直接嵌入聊天机器人。文章拿胶囊咖啡机举了个例子,但没提具体覆盖范围和广告价格怎么算。说白了,你搜东西时看到的“赞助产品”描述,以后可能都是 AI 写的,有些广告点进去还能跟机器人聊两句。

推荐理由:Google 开始在 Gemini 的商品搜索结果里塞赞助商品和广告聊天机器人了。我会先打个折:正文完全没提投放范围有多大、怎么收费、效果数据如何,所以这更像一次试探性铺开,而不是大规模产品发布。对从业者来说,值得盯的是它把广告嵌进对话式搜索的路径,但现阶段信息缺口太大,先别太激动。

5月20日星期三

The Verge · AI

如果连 Google 都做不出有用的 AI 智能体,那可能没人能了

Google 在 I/O 2026 上发了好几个 AI 智能体,能帮人搜资料、规划活动、总结邮件和日历。这些智能体可以在后台一直跑,但文章没提什么时候上线、怎么收费,也没给任何实测数据。作者的意思是,Google 在 AI 智能体上折腾了好几年,这次借着 OpenClaw 的热度再推一把,但如果连手握海量用户数据的 Google 都搞不定,那整个行业吹...

推荐理由:H 和 R 都很强,因为文章把 Google 的 agent 当成整个行业能不能成的风向标,而且直接踩中从业者对实用性、平台权力和成本的焦虑。K 给了新信息,但只限于后台运行这一点,正文没披露上线时间、定价和实际评测结果,所以整体还是落在 featured 偏下位置。

TechCrunch · AI

Figma 在协作画布里塞了个 AI 助手,能直接用对话生成和修改设计

Figma 在它的多人协作画布上直接加了一个 AI 助手。你可以用大白话让它生成新设计、改现有设计,或者自动跑一些重复活儿,比如批量出不同版本的设计稿。你还能同时开好几个助手,让它们各干各的。Figma 说这个助手能理解设计语境和元素,因为它背后用的模型是专门针对设计场景调过的。不过正文没披露这个助手具体是用自家模型还是接了别家的 API,也没提生成结...

推荐理由:Figma 把 AI agent 塞进了协作画布,你打字就能让它生成或改设计。我会先打个折:正文只说了能力范围,没提用的是什么模型、成本多少、什么时候上线,所以别太激动。但这件事本身值得关注,因为它意味着设计师的工作流可能要被 agent 插一脚了。

AI 群聊日报

Karpathy 加入 Anthropic 预训练团队,Google I/O 发布 Gemini 3.5 Flash 并给 Vertex AI 改名

今天最炸裂的消息是 Karpathy 宣布加入 Anthropic 预训练团队。群友分析,他先后拒绝回 Tesla 和加入导师的 world model 项目,唯独选了这里,说明大语言模型可能真要有新突破了。另一件大事是 Anthropic 收购 Stainless 后直接关停其托管服务,切断了 OpenAI 的 SDK 同步管道,群友把这叫“基础设施...

推荐理由:这是群聊日报的二手消息汇总,没有给出原始链接、具体任命细节或产品参数。Karpathy 去 Anthropic 这事我会先打个折,等官方确认再激动。Gemini 3.5 Flash 和 100 美元订阅档位正文没披露性能数据和权益清单,只能当个风向标看。整体信息量够上推荐,但可信度和细节都偏弱,所以放在 featured 的低分段。

AI HOT 精选

OpenAI 给每家 YC 创业公司投 200 万美元 API 额度,换股权

OpenAI 要给 Y Combinator 当前批次的每家创业公司提供价值 200 万美元的 API 信用额度,不是现金,是直接抵扣调用 GPT 等模型的费用,换取一定股权。正文没披露具体占股比例、额度有效期和使用上限。这招有点像当年 Sam Altman 在 YC 当合伙人时,Yuri Milner 给每家创业公司投钱的打法,只不过这次 OpenA...

推荐理由:我会先打个折:正文没写股权比例、使用期限和额度上限,所以这笔账到底划不划算还不好说。但 OpenAI 直接拿 API 额度换 YC 系公司的股权,等于在早期就把自己嵌进一堆创业公司的技术栈里,锁客意图很明显。对缺钱的团队来说,200 万美元的 API 信用确实能省下一大笔早期推理成本,只是别忽略绑定的代价。这点先别太激动,等条款出来再算总账。

AI HOT 精选

微软内部警告:AI 编程工具让 GitHub 的代码托管生意面临生存危机

微软内部认为,Cursor、Claude Code 这类 AI 编程助手正在改变开发者写代码和协作的方式,大家不再需要频繁把代码传到 GitHub 仓库,这让 GitHub 的托管业务受到根本性冲击。微软已经要求部分团队在 2026 年 6 月底前停用 Claude Code,统一改用自家的 GitHub Copilot CLI,表面理由是统一工具链和...

推荐理由:这条消息的杀伤力在于“内部示警”和“生存级风险”这两个词,把 AI 编程工具对 GitHub 托管业务的威胁摆到了台面上。我会先打个折:目前只有一家媒体爆料,微软和 GitHub 都没公开回应,所以不能当定论看。但信息量够硬——微软一边推 Copilot CLI,一边给 Claude Code 设了停用 deadline,说明内部已经在用行政手段抢开发者入口了。对从业者来说,这比单纯的产品更新更有嚼头:如果 AI 编程工具真的让代码托管变得可有可无,GitHub 的护城河就塌了一大块。正文没披露这个决策覆盖多大规模、是否全球执行,这点先别太激动。整...

AI HOT 精选

通义千问发布 Qwen3.7-Max,主打长时间自主干活和跨平台编程

Qwen 团队推出了 Qwen3.7-Max,一个专为智能体场景设计的闭源模型。它最显眼的能力是能长时间自主执行任务,官方演示了一个连续跑 35 小时、调用上千次工具的内核优化任务。在编程方面,它在 Terminal Bench 2.0 上拿了 69.7 分,超过了 DeepSeek-V4-Pro Max 的 67.9 分;在 SWE-Pro 这类复杂...

推荐理由:Qwen Studio 发了 Qwen3.7,一口气覆盖聊天、图像视频理解、图像生成、文档处理、网页搜索、工具调用和工件生成,摆明要往智能体方向走。我会先打个折:正文没给任何 benchmark、定价、上下文窗口或延迟数据,所以没法判断实际可用性和成本。亮点是工具调用和工件生成这两项,说明模型不只是聊天,而是被设计成能进业务流程干活。这点先别太激动,等看到具体评测和接入方式再说。

AI HOT 精选

Gemini 3.5 Flash 发布:价格涨了,但谷歌打算把它塞进所有产品里

谷歌在 I/O 大会上直接发布了 Gemini 3.5 Flash,跳过预览阶段。输入价格涨到每百万 token 1.5 美元,输出 9 美元,分别是上一代 Flash 预览版的 3 倍和 Flash-Lite 的 6 倍,已经快追上自家的 Pro 型号了。涨价不是谷歌一家的事,OpenAI 和 Anthropic 的新模型也都在提价,各家似乎都在试探...

推荐理由:我会先打个折:正文只给了价格和全面铺开的意图,没提能力提升、跑分或上下文窗口,所以没法判断涨得值不值。但涨价幅度本身对开发者是硬信号,值得放进精选。

AI HOT 精选

Gemini 推出个人 AI 代理 Spark 和每日简报,能跨 Gmail、文档、幻灯片自动干活

Gemini 这次加了两个功能。一个是 Gemini Spark,相当于一个常驻的个人 AI 代理,你授权后它可以自己在 Gmail、Google Docs 和 Slides 之间跑流程,官方说笔记本合上也能继续运行——这点先别太激动,正文没披露具体怎么实现、延迟和资源消耗也没提。另一个是 Daily Brief,根据你设定的个人目标,每天给你推定制摘...

推荐理由:Gemini 应用这次加了两个东西:Gemini Spark 可以在你授权后跨 Gmail、Docs、Slides 自动操作,Daily Brief 则给美国 18 岁以上订阅用户推送每日简报。等于从聊天助手往个人代理迈了一步,让模型直接进你的文档和邮件里干活。正文没提延迟、错误率和权限撤回细节,实际稳不稳还得看上线后的反馈。

AI HOT 精选

Claude Code 团队把主力输出格式从 Markdown 换成了 HTML

Claude Code 团队发现让模型直接生成 HTML 页面,比用 Markdown 更能把事说清楚。文章举了四个具体用法:用表格做对比、用 CSS 控制排版样式、用 SVG 画图表、用 JavaScript 加交互操作。他们没说性能数据或成本变化,更像是一篇内部实践分享,告诉你“我们这么用下来效果不错”。

推荐理由:Claude Code 团队把默认输出从 Markdown 切到 HTML,这篇官方博文列出了表格、CSS、SVG 和 JS 交互四种用法,说明 HTML 在展示结构化结果和可交互内容上比纯文本强。对写代码的人有实操参考价值,但不算重大产品发布,放在 featured 档合适。

TechCrunch · AI

Gmail 现在能直接语音问收件箱了,Google I/O 2026 上演示了用 Gemini 翻找邮件细节

Google 给 Gmail 的 AI 收件箱加上了语音对话搜索,你可以直接开口让 Gemini 帮你从邮件堆里挖出具体信息。目前正文没披露这个功能会推给哪些用户、支持什么语言、要不要额外付费、响应有多快,也没说背后是用什么检索机制把邮件捞出来的。

推荐理由:我会先打个折:这功能听起来挺方便,开车时动嘴就能查邮件里的航班号或报销金额。但正文只说了“可以语音搜 Gmail”,没交代支持哪些语言、是不是全球推送、要不要额外付费,也没讲清楚 Gemini 到底怎么从邮件里捞出答案——是直接扫全文还是先建索引。这点先别太激动,等有实测再判断到底省不省事。

The Verge · AI

Google I/O 画了一堆 AI 大饼,但前提是你得把个人数据交出来

Google 在 I/O 2026 上发布了 Gemini Spark(常驻 AI 助手,能帮你张罗活动)、Daily Brief(每日简报)和 Gmail AI 收件箱(根据邮件自动生成待办和回信草稿)。这些功能听起来都挺实用,但核心都是靠大量个人数据喂出来的。文章点出了这个信任问题,不过正文没披露具体的数据处理条款,所以先别急着说它安全还是不安全。

推荐理由:Google 在 I/O 2026 亮出的几个新工具,核心卖点是替你读邮件、替你整理信息,但前提是你得把大量个人数据交出去。正文只说了这些功能依赖个人信息,没写数据怎么处理、存多久、会不会拿去训练模型。我会先打个折:产品方向很明确,就是让 AI 住进你的邮箱和日程里,但隐私和信任那部分目前只有表态,没有细节。这点先别太激动,等 Google 把数据处理规则说清楚再判断值不值得跟进。