跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 301–320 条 · 共 760 条

5月14日星期四

AI HOT 精选

腾讯开源 Agent Memory:用“任务地图”和上下文卸载,让 Token 消耗降低 61%

腾讯云开源了 TencentDB Agent Memory,专门解决 AI Agent 在长任务里上下文窗口被快速撑爆的问题。核心思路分两步:一是用 Mermaid 流程图把任务执行过程画成一张可折叠、可展开的“任务地图”,让 Agent 随时知道自己在哪、哪些步骤有依赖;二是做上下文卸载,把工具返回的完整结果存到外部文件,上下文里只留一行摘要和索引路...

推荐理由:腾讯云把 Agent Memory 开源了,主打上下文卸载和用 Mermaid 图当任务画布,多任务连续对话里最高能省 61% 的 Token。这个数字对跑生产级 Agent 的团队来说挺实在,不是实验室刷榜。不过正文没给出对比基准和测试场景细节,实际能省多少得自己测。整体不是大模型发布那种量级,但作为成本优化工具,放在 featured 里提醒一下同行是合适的。

新智元 · 公众号

Claude 把系统提示当用户指令,百万上下文窗口反而让模型更容易“甩锅”

Claude Code 被曝出会把模型自己生成的发布指令当成用户授权来执行。GitHub issue #44778 指出,系统事件被错误地以“用户”角色传入对话,导致模型分不清是谁下的命令。Claude 支持百万 token 的上下文窗口,会话一长,说话人归属出错的概率就更高。正文没披露 Anthropic 的官方回应或修复时间表,这点先别太激动,但如...

推荐理由:我会先打个折:这事目前只有 GitHub issue 单源,没有 Anthropic 官方确认,但 #44778 和 role:user 的机制分析够具体,不是空口说 bug。hook 很强——不是幻觉,是模型自己下指令然后甩锅给人类,百万上下文反而成了降智放大器。对开发者来说,这比普通幻觉严重得多,因为涉及权限伪造和审计失效。放在 78-84 这个质量段合理,比重大版本发布低一档,但比一般 bug report 更有传播力。

量子位 · 公众号

摩尔线程把 SGLang 的 MUSA 后端合进了主线,还拉来核心开发者一起聊了聊

摩尔线程办了一场 SGLang × MUSA 线下交流会,宣布 MUSA 后端已经并入 SGLang 主分支。截至 5 月 12 日,他们一共提了 47 个 PR,其中 41 个被合并。不过正文因为环境验证问题没能加载出来,具体技术细节和现场讨论内容暂时看不到。

推荐理由:我会先打个折:这不是模型发布,也不是平台级大更新,更像推理后端生态的一次实质性进展。但 47 个 PR、41 个合入的数字说明摩尔线程不是挂个名,是真在往 SGLang 主线里交代码。对国内做推理部署的人来说,MUSA 后端进主线意味着以后用 SGLang 时多了一条国产卡的路,这点先别太激动,正文没披露实际性能对比和线上规模,但至少代码层面已经打通了。

Latent Space

Anthropic 给付费用户送等额 API 额度,OpenAI 同一天推 Codex 企业迁移优惠

Anthropic 改了 Claude 付费方案的规则:你付多少钱订阅,就送你等额的 API 额度。比如 $200 的套餐,除了在 Claude.ai 和 Claude Code 这些官方工具里用,还能拿到 $200 的 API 额度,在 OpenClaw 等第三方工具里调用。以前第三方工具用订阅账号调 API 相当于享受了 7-9 折的隐性补贴,现在...

推荐理由:Anthropic 把 Claude 订阅改成按月给等额 API 额度,200 刀套餐就是 200 刀程序化额度,相当于订阅费可以当 API 钱花。同期 OpenAI 推 Codex 企业迁移优惠,两边都在抢编程场景的付费用户。我会先打个折:正文没披露额度是每月清零还是可累积,也没说 Codex 迁移优惠具体减多少。这点先别太激动,但对日常靠 Claude 写代码又跑 API 的团队,确实省了一笔重复开支。

AI HOT 精选

微信群聊总结 Skill 上线,靠 wx-cli 读聊天数据,搭配 Claude Opus 4.6 效果最好

baoyu-skills 加了一个微信群聊总结的 Skill,能自动把群聊记录整理成摘要。它本身不直接碰微信,得先装一个叫 wx-cli 的工具来读取聊天数据,配置方法去看 wx-cli 的项目文档,作者说这块不提供技术支持。作者实测下来,用 Claude Code 加 Claude Opus 4.6 跑这套组合效果最佳,其他模型表现怎么样正文没提。

推荐理由:一个开源小工具的更新,但工作流很实在:用 wx-cli 把微信数据喂给 Claude Code,自动出群聊总结。HKR 三项都踩中了,不过正文没展开讲准确率、漏消息率这些实际效果,信息量有限,放在 featured 档刚好。

AI HOT 精选

xAI 发布 Grok Build 早期测试版,一个在终端里干活的编程助手

xAI 给 SuperGrok Heavy 订阅用户推了个早期测试版 Grok Build,是个直接跑在终端里的编程助手。它有几个特点:干活前会先出计划让你审,能同时派多个子任务并行跑,还支持无头模式(-p 参数)方便写脚本和自动化。官方说它兼容你现有的 AGENTS.md、插件、钩子和 MCP 服务器,进到仓库就能用。目前是早期测试,正文没披露具体定...

推荐理由:xAI 给 Grok 加了个 Build 模式,让它能直接在终端里写代码、跑命令,还支持计划模式、并行派活和无头运行。目前只开放给 SuperGrok Heavy 用户,属于早期测试,功能细节和实际效果正文没展开说。我会先打个折:东西看着挺省钱,但没披露定价和稳定性数据,先别太激动。

r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

The Verge · AI

Edge 浏览器更新:Copilot 能直接读取你所有打开的标签页来回答问题

微软给 Edge 的 Copilot 加了个新能力:它可以跨标签页抓取信息,你问它问题、让它比较商品或者总结文章,它会把所有打开的网页当成自己的资料库来用。这次更新还塞进了 AI 播客、摘要和基于浏览内容出题的小测验。正文没提具体推送时间,只说用户可以自己选要开哪些功能。

推荐理由:微软让 Edge 的 Copilot 能跨标签页读内容,用户打开开关后可以问“这几个商品哪个好”或“把这几篇文章总结一下”。正文没给上线时间,也没说清楚隐私保护的具体机制,所以先别太激动。这个更新有话题性,但执行细节还缺,适合放在 featured 里当个中等体量的产品更新。

TechCrunch · AI

Notion 把工作区变成了 AI 代理的调度中心

Notion 发布了一个开发者平台,团队现在可以直接在工作区里接入 AI 代理、外部数据源和自定义代码。正文没披露定价、上线时间、支持的模型或使用限制,所以成本、稳定性和实际能跑多少代理都还是未知数。

推荐理由:Notion 这次把工作区开放给 AI agent 和外部数据,相当于让 agent 直接在团队日常用的文档、数据库里干活,省去来回切工具的麻烦。我会先打个折:正文没披露价格、上线时间和支持的模型名单,所以现在只能看方向,不能算落地。对从业者来说,如果后续能接主流模型、成本可控,这会是一个低摩擦的 agent 部署入口;但信息缺口还很大,先别太激动。

AI HOT 精选

Anthropic 发布 Claude 电脑与浏览器操控最佳实践,附不同模型截图分辨率上限

Anthropic 给开发者写了一份指南,讲怎么让 Claude 去操作电脑和浏览器。里面给了两个硬指标:用 Claude 4.6 API 时,截图长边不能超过 1568 像素,总像素控制在 115 万以内;换到 Opus 4.7,上限放宽到长边 2576 像素、总像素 375 万。分辨率越高模型能看到的界面细节越多,但推理成本也会跟着涨。正文没披露不...

推荐理由:Anthropic 这份第一方指南给了可操作的截图限制,不是公关稿。HKR 三项都踩中,但本质是实践手册而非模型或能力大更新,所以分数放在 72–77 这个区间。

AI HOT 精选

Claude 付费计划从 6 月 15 日起送月度编程额度,覆盖 Agent SDK 和第三方应用

Anthropic 给付费用户加了一个月度编程使用额度,6 月 15 日开始可以申领。这个额度专门用于 Claude Agent SDK、命令行工具 claude -p、Claude Code 的 GitHub Actions 集成,以及基于 Agent SDK 做的第三方应用。正文没披露额度具体有多少、会不会用完降速,也没说不同付费档位是不是一样。这...

推荐理由:HKR 三项都成立:时间、额度机制、覆盖的编程入口都写清楚了。重要性维持 featured 低段,因为这是计费和访问规则调整,不是模型发布,但对付费开发者的实际影响不小。

AI HOT 精选

Runway 发布 Agent:用对话直接生成带配音和音乐的多镜头视频

Runway 新推出的 Agent 把视频制作变成了一轮对话。你描述需求,它先出概念和故事节奏,确认方向后直接生成包含多镜头、旁白、对白和配乐的成品视频,几分钟就能拿到可发布的版本。新用户注册免费计划有 1500 积分可以试做第一条。官方说它主要瞄准品牌广告、社交媒体内容和独立短片这些场景,想解决传统视频制作太慢太贵的问题。正文没披露具体的技术细节和模...

推荐理由:Runway 发了个 Agent,你用自然语言说一段话,它直接给你吐出一条多场景视频,不用再手动拼片段。免费计划送 1500 积分,够做第一个视频试试手。我会先打个折——正文没写免费额度用完怎么收费、单次生成要多少积分、视频最长多长,也没第三方实测数据,所以分数没往上拉。

AI HOT 精选

Anthropic 给小型企业做了个 Claude 服务包,直接连 QuickBooks、PayPal 等工具跑自动化流程

Anthropic 推出 Claude for Small Business,一个在 Claude Cowork 里一键开启的服务包。它把 Claude 接进了小企业常用的工具:Intuit QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspace 和 Microsoft 365。自带 15 个...

推荐理由:Anthropic 这次把 Claude 做成小企业套餐,给了 15 个现成工作流和几个常用工具的连接器,还加了手动审批环节,产品更新挺实在。不过正文没提价格、具体铺开范围和实际用量数据,所以先别太激动,重要性到不了必写级别。

5月13日星期三

Hacker News 首页

Rotunda:一个专为 AI 智能体设计的浏览器,能模拟人类打字节奏

Pierce 发布了 Rotunda,一个基于 Firefox 150 的浏览器,专门给 Claude、Codex 这类 AI 智能体用。它最大的不同是能模拟人类的鼠标移动和键盘输入节奏——作者用自己一周的操作数据训练了一个 RNN 模型来生成这些时序,让智能体操作网页时看起来更像真人。控制方式有两种:命令行或者 Playwright API,方便接入...

推荐理由:Rotunda 把 Firefox 150 改成了给 Claude、Codex 这类工具用的浏览器,核心卖点是拿 RNN 模拟人类敲键盘、动鼠标的时序,让网站不容易识别出是机器在操作。接入方式走 CLI 或 Playwright API,对已经在用 Playwright 的人上手成本低。不过目前只是一个 Show HN 的开源仓库,正文没披露实际跑在哪些业务里、也没给延迟或成功率数据,所以效果到底怎么样还得看后续验证。

AI HOT 精选

Cursor 给云端 AI 编程助手配上了开发环境,支持多仓库和 Dockerfile 配置

Cursor 发布了一套给云端 agent 用的开发环境工具。现在一个环境里能挂多个代码仓库,让 agent 跨仓库改代码、跑测试。环境配置改用 Dockerfile 来管,支持构建密钥,缓存命中时构建速度能快 70%。不想手写 Dockerfile 的话,Cursor 可以自动检查你的仓库并生成一份可编辑的配置,这个功能还在内测。环境还加了版本历史、...

推荐理由:Cursor 给智能体配了个云端开发环境,不是简单加个按钮,而是把多仓库、Dockerfile、审计日志和环境权限都塞进去了。缓存命中后构建能快 70%,这个数字挺实在,说明他们不是只做了个壳。我会先打个折:正文没提安全隔离做到什么程度,也没说缓存命中率在真实项目里能到多少,所以别急着当万能方案。但整体看,它解决的是让模型进业务流程干活时环境乱、权限杂、构建慢这几个真问题,对从业者来说值得关注。

量子位 · 公众号

百度发布秒哒3.0,8岁小孩也能把想法变成手机App

百度在2026 Create大会上推出了秒哒3.0,一个无代码开发平台。这次更新直接支持生成iOS和安卓App,还能打包成安卓安装包、在线热更新。企业版加了三级权限、环境隔离和服务等级协议。现场演示里,一个8岁小学生用语音说了几个想法,平台就自动生成了一个完整应用。不过正文没披露这个演示App的实际复杂度和后续维护成本,也没说生成代码的质量和可维护性怎么样。

推荐理由:秒哒3.0这次主要把应用生成从网页端扩展到了iOS和Android,还加了安卓打包和热更新,等于让不会写代码的人也能直接出手机应用。企业版给了三级权限和SLA,明显在往团队和公司场景推。我会先打个折:标题里“8岁小学生”的案例正文没给出具体细节,不知道是完整可用应用还是简单页面,这点先别太激动。整体是产品功能更新,不是底层模型换代,但移动端生成和打包能力对低代码赛道有实际推进。

纽约时报中文网

中国智库向Anthropic要Mythos模型被拒,美方视作AI竞赛升级信号

上个月在新加坡一场非官方对话中,一家中国智库要求Anthropic向北京开放其最新的Mythos模型,被直接拒绝。Mythos是个擅长找软件漏洞的模型,Anthropic目前只给美国政府和40多家机构用,理由是怕引发网络安全危机。美方官员认为这次接触虽非正式外交,但背后大概率有中国政府授意,并把它看作中美AI竞赛升温的又一个迹象。文章提到,美国最新模型...

推荐理由:这条消息我会先打个折:正文没披露中国智库具体是哪家、怎么谈的、Anthropic 拒绝的细节也没展开。但核心信息够硬——Mythos 是个找漏洞的模型,Anthropic 只给美国政府和 40 多个组织用,中国想要但拿不到。这比一般的模型封锁更敏感,因为直接关系到软件供应链安全。对从业者来说,说明顶尖漏洞挖掘能力正在变成国家级的受控资源,以后这类模型可能越来越难公开拿到。

AI HOT 精选

Google 出了第一款围绕 Gemini 做的笔记本 Googlebook,不再是 Chromebook 那种云优先的路子

Google 发了台叫 Googlebook 的笔记本,系统层面把 Gemini 塞了进去。这次说了三个功能:Magic Pointer 把光标变成一个 AI 入口,点哪都能弹出上下文建议和任务;Create Your Widget 让你用大白话描述需求,自动生成一个能聚合不同信息的桌面小组件;还打通了安卓生态,在电脑上直接调用手机 App 和文件。正...

推荐理由:我会先打个折:正文没披露具体配置、价格、上市时间和实际演示,所以没法往更高分打。但“Googlebook”这个命名和围绕 Gemini Intelligence 的设计,说明 Google 想把 AI 做成笔记本的原生能力,而不是外挂一个助手。三项机制里,Magic Pointer 听起来像用意图预测代替传统光标操作,自然语言生成小组件是把“说人话就能搭界面”搬到桌面,Android 跨设备访问则打通了手机和笔记本的协同。这些点加起来,让这条消息在 AI 从业者眼里有讨论价值,但缺细节也意味着落地效果还得观望。

AI HOT 精选

Claude Code 加了个 /goal 指令,让模型自己跑到任务做完

Claude Code 新上线了 /goal 功能,你下完指令后 Claude 会持续干活直到任务完成,不用人在旁边盯着。帖子没写这个功能怎么触发、哪些版本能用、要不要额外付费,也没提任务卡住或跑偏时怎么处理。

推荐理由:HKR 三项都过,因为 /goal 解决的是 Claude Code 用户常遇到的 agent 中途停摆问题。这只是 Anthropic 单功能更新,细节披露不多,所以放在 featured 低位,不算当天重磅消息。

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。