跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 601–620 条 · 共 760 条

4月14日星期二

X · @dotey(宝玉)

Claude Code 关掉遥测后缓存从 1 小时掉到 5 分钟,工程师解释是实验开关失效,不是故意惩罚

开发者 Can Vardar 发现 Claude Code 关闭遥测后,提示缓存时间从 1 小时骤降到 5 分钟,他算了一笔账说这是用隐私换 12 倍性能。Anthropic 工程师 Boris Cherny 回应说,1 小时缓存写入成本高、读取成本低,不是无条件更好,如果你只跑一次查询就走,1 小时缓存反而浪费钱。关遥测导致缓存变短,是因为客户端的实...

推荐理由:这条信息对Claude Code用户很实用,把隐私开关和缓存成本的关系讲清楚了。我会先打个折:来源是X上的工程师回复,不是正式公告,但机制解释和后续计划都来自Anthropic员工,可信度够。正文没披露环境变量什么时候上线,这点先别太激动。

4月13日星期一

最佳拍档

谷歌CEO皮查伊:2027年是企业AI落地爆发年,搜索不会死,会变成替你干活的管家

谷歌CEO皮查伊在2026年4月的一次专访里,把家底和判断都摊开了。他说明年(2027年)会是企业AI agent workflow(让模型进业务流程干活)的爆发点,AI将从程序员提效工具变成非技术岗位的智能核心。关于搜索,他认为不会被聊天机器人取代,而是会进化成一个“Agentic Manager”,能直接帮你规划旅行、处理多线程任务,他自己已经在用...

推荐理由:这不是产品发布,而是高管在访谈里给出的判断和内部数据,信号密度很高。Pichai 把 2027 年定为 Agent 爆发点,配合千亿级资本开支和毫秒级延迟管控,让这个判断比一般预测更有分量。搜索演进和算力稀缺这两条线也直接关联从业者当下的决策。分数没给到 P1,因为信息来自二手转述而非一手访谈原文,但 H、K、R 三项都扎实成立。

4月12日星期日

X · @Yuchenj_UW

MiniMax 开源 M2.7,并公开了用模型自己跑研发流程的实验结果

MiniMax 把 M2.7 开源了,同时发了一篇博客讲他们怎么让模型参与自己的研发。他们做了两件事:一是搭了个研究助手 agent,帮研究员查文献、盯实验流程、看日志、改代码、提 merge request,现在能扛起 30% 到 50% 的研发工作量。二是让 M2.7 自己改自己的测试脚手架,全自动跑了 100 多轮,内部代码评测涨了 30%。博客...

推荐理由:MiniMax 把 M2.7 开源了,同时扔出一个挺敢说的数字:他们内部的研究代理已经扛了 30% 到 50% 的研发流程。具体怎么干?代理自己查文献、排实验、看日志、修代码、提合并请求,还在内部脚手架里自己改 harness,自动循环了 100 多轮,内部编码评测涨了 30%。我会先打个折——正文没披露许可证、仓库地址、基准测试上下文,也没说外部能不能复现,所以这些数字目前只能当内部说法看。但即便打对折,代理能稳定吃掉三成研发流程,这个信号也够强了。

4月11日星期六

X · @dotey(宝玉)

Anthropic 公测 Claude Managed Agents,用 Vaults 把用户第三方密钥和模型上下文隔开

Anthropic 给 Claude Managed Agents 加了一个叫 Vaults 的组件,专门管每个终端用户的第三方账号密钥。开发者给每个用户建一个 Vault,把 Linear API Key、GitHub Token 这类凭证存进去,启动会话时只传 vault_id,基础设施会在模型需要调外部工具时自动把凭证塞进去。关键设计是隔离:凭证...

推荐理由:这篇补上了 Claude Managed Agents 公测里最缺的实现细节:第三方凭证怎么隔离。HKR 三项都站得住——安全钩子具体、流程可复现、定价明确,而且直接回应了 agent 团队部署时最头疼的密钥管理问题。影响面停留在开发者集成层,所以维持 featured。

X · @OpenAI

OpenAI 因 Axios 库安全问题要求所有 macOS 用户更新应用,主要是换证书防山寨

OpenAI 说他们发现一个跟第三方开发库 Axios 有关的安全问题,属于一次行业性事件。目前没看到用户数据被访问、系统被入侵或软件被篡改的证据。出于谨慎,他们正在更新 macOS 应用的认证证书,所有用户都得升级到最新版。这么做的目的是降低有人分发假冒 OpenAI 应用的风险,哪怕可能性很小。正文没披露受影响的版本号和时间线,也没说 Axios ...

推荐理由:这是 OpenAI 官方桌面端的安全事件,给了 macOS 上的具体缓解措施,所以 H、K、R 都站得住。放在 featured 低分段是因为正文没披露受影响版本、暴露窗口、发现日期和完整修复时间线,信息缺口不小。

X · @dotey(宝玉)

OpenAI Codex 工程师:别反复给 AI 喂脏数据,给它造几个专用命令行工具

OpenAI Codex 团队的 Nick Baumann 分享了一个干活技巧:与其每次把文档、日志、API 输出整坨丢给 AI 去啃,不如把常用操作封装成带参数、输出 JSON 的 CLI 命令。Codex 本身就擅长用命令行,会自己搜命令、加 flag 筛选、把上一个命令的结果串到下一个,不需要你教它怎么调。他自己日常用三个自建工具:codex-t...

推荐理由:这是 OpenAI Codex 团队成员写的日常心得,不是正式发布,但提供了一个很实用的机制:把杂乱的日志、文档、API 输出包成带参数、返回 JSON 的 CLI 命令,让模型去调这些窄接口,而不是直接读原始数据。文章给了三个他自用的工具,教程和 skill 也放到了开发者文档里。没有基准测试、规模数据或重大产品更新,所以分数打 75。

X · @dotey(宝玉)

Anthropic 发布 Claude for Word 插件测试版,直接在 Word 侧边栏改文档

Claude 现在能直接嵌进 Word 干活了。选中文字用自然语言说怎么改,修改结果会以 Word 原生的“修订模式”呈现,接受或拒绝都在审阅面板里完成,不用再把内容复制到网页端来回倒。它会识别标题样式、编号和项目符号,改完格式不乱。你还可以上传参考文档,写作时标注引用来源。团队能把反复用的工作流(比如合同审查)封装成 Skill,一键复用。这个插件和...

推荐理由:这是 Anthropic 面向 Team 和 Enterprise 的一个有料的产品更新,不是泛泛的集成公告。HKR 三项都踩中了:钩子够直接、机制有细节、卡位也准。但我会先打个折——目前只是测试版,正文没披露定价、地区和正式发布时间,所以热度先控在中等偏上。

X · @dotey(宝玉)

Claude Code 新增 ultraplan:在终端发起规划,去浏览器审阅批注,再决定云端或本地执行

Claude Code 推出了 ultraplan 预览功能,把代码规划从终端搬到了浏览器。你在终端输入 /ultraplan 加需求描述,Claude 会在云端读代码库、起草实现方案,终端不占着,你可以干别的。方案写好后在浏览器里打开,像审文档一样对具体段落加批注、打表情、反复改到满意。最后二选一:让云端直接执行并开 PR,或者把方案拉回本地终端跑。...

推荐理由:Claude Code 这次更新不是加个小功能,而是把规划从执行里拆出来。你在终端敲 /ultraplan,Claude 去云端读代码库、出方案,你在浏览器里像改文档一样批注修改,满意了再决定让云端直接跑完开 PR,或者拉回本地终端自己跑。规划阶段终端不卡住,正文说 token 消耗跟本地 plan 模式差不多,这点先别太激动,等实测数据。目前还是预览版,只对开网页版的用户开放,正文没披露云端规划的实际延迟和成功率。

X · @claudeai

Claude 出了 Word 插件,现在可以在侧边栏直接写稿、改稿

Anthropic 把 Claude 塞进了 Word,目前是测试版。你在文档侧边栏就能让它帮你起草、编辑和修改内容,Claude 会保留原有格式,改动以修订模式显示,方便你逐条确认。这个功能只开放给 Team 和 Enterprise 用户,正文没提价格、支持地区,也没说什么时候正式上线。

推荐理由:这是个有用但分量中等的 Anthropic 产品更新。官方帖子确认了 Word 侧边栏入口、Team 和 Enterprise 方案可用、保留原有格式并以修订模式显示改动,所以 K 和 R 都站得住。但价格、地区和具体上线时间都没说,信息缺口明显,只能放在 featured 的低位。

4月10日星期五

X · @dotey(宝玉)

Anthropic 新 API 让便宜模型干活、贵模型当军师,Haiku 配 Opus 在 BrowseComp 分数翻倍,成本只要 Sonnet 的 15%

Anthropic 推出了“顾问工具”API,让 Sonnet 或 Haiku 作为执行者跑任务,遇到难决策时把上下文递给 Opus 出主意,Opus 不碰工具、不直接输出,只当幕后军师。这跟常见的“大模型拆任务、小模型执行”反过来了,好处是大部分 token 烧在便宜模型上。Sonnet 配 Opus 在多语言 SWE-bench 上比单干高 2.7...

推荐理由:Anthropic 这次 API 更新挺实在,不是画饼。核心就是让 Sonnet 或 Haiku 当执行者跑任务,卡壳时再问 Opus,而且是在同一次 API 请求里完成模型切换,Token 分开算钱。给的数字也清楚:Sonnet+Opus 在多语言 SWE-bench 上比单用 Sonnet 高了 2.7 个百分点,单任务成本还降了 11.9%;Haiku+Opus 在 BrowseComp 上从 19.7% 跳到 41.2%,成本只要 Sonnet 的 15%。我会先打个折,毕竟还在 beta,但这条路子对控制推理成本确实有用,值得关注。

X · @OpenAI

OpenAI 给 ChatGPT 加了个 100 美元/月的 Pro 档,主要给 Codex 重度用户用

OpenAI 新设了一个每月 100 美元的 Pro 订阅档,Codex 用量是 Plus 档的 5 倍,适合长时间、高强度的编程任务。这个档位保留了原 Pro 的全部功能,包括专属 Pro 模型以及 Instant 和 Thinking 模型不限次使用。到 5 月 31 日前有个限时活动,Codex 用量临时提到 Plus 的 10 倍。正文没解释为...

推荐理由:OpenAI 给 Pro 加了个每月 100 美元的新档位,核心是把 Codex 用量提到 Plus 的 5 倍,其他 Pro 功能不变。5 月底前有个临时福利,Codex 额度再翻倍到 10 倍,但我会先打个折,这只是限时促销。真正值得盯的是,他们开始把代码代理这种重度用法单独拿出来计费,说明以后高强度用 AI 写代码可能要多掏钱。正文没提新模型或技术突破,所以重要性主要落在定价信号上,对团队预算和工具选型有直接参考价值。

X · @claudeai

Claude Cowork 向所有付费用户开放,企业版加了权限和花费管控

Anthropic 把 Claude Cowork 从测试转成了正式功能,Pro、Team、Enterprise 都能用。企业版这次主要给管理员加了几个控制项:按角色设访问权限、给团队设花费上限、看用量报表,还接入了 OpenTelemetry 方便监控。正文没提具体定价、调用次数上限和推送时间。如果是真的,对想在全公司铺开用的团队来说,管钱管权限会方...

推荐理由:Anthropic 把 Claude Cowork 推给所有付费用户,企业版多了角色权限、分组花钱上限、用量统计和更全的遥测接入。我会先打个折:正文没写价格、配额和具体上线时间,所以别急着算账。真正值得看的是治理那几条腿终于补齐了,但组织级部署的细粒度参数还没亮出来。

4月9日星期四

量子位 · 公众号

Claude 推出托管 Agent 服务,按小时收费,转头就被开源方案 Multica 平替了

Anthropic 上线了 Claude 的托管 Agent 服务,让模型能长时间跑任务、多 Agent 协作,还带沙盒和断点恢复。收费分两块:会话时长每小时 0.08 美元,外加按量计费的 token 消耗;联网搜索每千次 10 美元。部分记忆和编排功能还在研究预览阶段。标题里提到的“封杀龙虾”正文没解释,实际重点是 Anthropic 开始向企业卖...

推荐理由:这是一次有实质内容的 Anthropic 产品更新:托管 Agent 服务带了明确定价、沙箱、检查点恢复和搜索费用,信息密度够,所以 HKR-K 很强。HKR-R 对 Claude 重度团队有真实参考价值,但影响面比模型发布小,因此重要性定在 84、featured 合理。标题提到的“封杀龙虾”正文没展开,这点先别太激动,真正该盯的是 Anthropic 开始把 Agent 基础设施当商品卖。

X · @dotey(宝玉)

Anthropic 发布 Claude Managed Agents,把 Agent 开发的基础设施全托管到云端,现已公测

Anthropic 推出了一套托管 API,让开发者不用自己搭沙箱、管状态、做权限和链路追踪,直接定义任务和工具就能上线生产级 Agent。官方说从原型到上线能从几个月缩到几天。它支持长时间运行的会话(断线不丢进度)和多 Agent 协调(一个 Agent 能拉起其他 Agent 并行干活,后者还在研究预览阶段)。内部测试里,在结构化文件生成任务上,这...

推荐理由:Anthropic 把 Agent 的沙箱环境、长时运行会话和多 Agent 协调打包成一个公测 API,对开发者来说是个实打实的工作流更新。我会先打个折,内部测试的 10 个百分点提升要看具体场景,但 0.08 美元一小时的定价和标准 token 费分开算,成本结构很清晰。正文没披露多 Agent 协调的具体机制和失败案例,这点先别太激动。整体看,这不是一个模型更新,而是一个平台级动作,值得从业者盯一下。

X · @claudeai

Claude 推出托管 Agent 服务公测版,把原型到上线压缩到几天

Claude 平台上线了 Claude Managed Agents 公测版,核心卖点是给了一套调过性能的 agent 运行框架加上生产环境基础设施,号称能把 agent 从原型做到上线的时间压到几天。正文没披露具体怎么收费、支持哪些工具链、能跑什么模型、有没有调用额度限制,这些关键信息都得等后续公布。

推荐理由:Anthropic 这次放出的 Managed Agents 是个公开测试,核心卖点是把 agent 从想法到上线的时间压到几天,对用 Claude 搭业务的人是个直接利好,所以重要性和相关性都过关。但我会先打个折——文章只说了有“性能调优的 agent harness”和配套生产设施,具体怎么收费、支持哪些工具、能跑什么模型、有没有调用上限,一概没写。这点先别太激动,缺的信息恰恰是决定能不能真省钱、真省事的关键。整体看,它解决的是 agent 规模化落地的运维和速度问题,对从业者来说是个实在信号,但落地效果还得等更多细节。

4月8日星期三

量子位 · 公众号

小米放出两个语音生成框架,想让普通人也能当“声音导演”

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音,Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化...

推荐理由:小米放出两套语音框架,核心看点是可控长音频和场景统一建模,一句提示词出混合音频、单次推理能跑10分钟,这两个点确实抓人。技术细节也给了,不是纯画饼。但我会先打个折:基准跑分没给,训练数据多大不知道,开不开源、能不能商用也没说,这些信息缺口让实际价值不好判断。整体有亮点但缺关键验证,放在 featured 低段比较合适。

量子位 · 公众号

面壁智能、OpenBMB 和清华放出一个 2B 开源语音模型 VoxCPM 2,能说 9 种方言、30 种外语,还复刻了郭德纲的《莽撞人》贯口

VoxCPM 2 是个 20 亿参数的开源语音模型,主打低延迟和少样本复刻。官方说生成经常在 1 秒内完成,给一段 5 秒以上的参考音频就能模仿音色和风格,演示里用它念了语速极快的相声贯口《莽撞人》。技术上它没用传统的声学码本,而是走扩散自回归连续表征路线,支持去噪、LoRA 微调和全量微调。正文没披露具体的训练数据规模和硬件需求,也没给标准化的语音质...

推荐理由:面壁智能和清华 OpenBMB 放出的 VoxCPM 2 是一个 2B 开源语音模型,不是薄 demo。正文列了可复现条件:48kHz、9 种方言、30 种外语、≥5 秒参考音频、1 秒内生成,还支持降噪和 LoRA/全参微调。技术路线上走了 tokenizer-free 的扩散自回归连续表征,这点比模型尺寸更值得看。我会先打个折:正文没披露方言和外语的具体测试集与客观指标,也没给端侧实测延迟和内存占用,所以实际部署成本还要自己测。但整体信息量够,对盯中文开源语音栈的人有参考价值。

Latent Space

OpenAI 内部团队用 5 个月跑出一个零人工代码的项目,每天烧掉 10 亿 token

Ryan Lopopolo 的团队在 OpenAI 内部搞了个极端实验:5 个月里搭出一个超过 100 万行代码的仓库,所有代码全由 Codex 生成,合并前没有任何人工审查。他们每天消耗超过 10 亿 token,按市价估算大概一天要花 2000 到 3000 美元。团队的核心思路是,当 AI 写代码卡住时,不去教它怎么改 prompt,而是回头补上...

推荐理由:这篇是访谈转述,不是官方发布,所以我会先打个折。但内容确实有料:OpenAI Frontier 团队用 5 个月搭了个内部测试产品,代码库超 100 万行,每天消耗超 10 亿 token,合并前完全没人类写码也没人类审查。具体做法是把失败拆成缺能力、缺上下文、缺结构三类,然后用 Symphony 多代理编排、规格文档、测试、可观测性和 1 分钟内构建循环来兜底。真正值得盯的是他们说的那句话——流程重心从人审代码转到了人设计 harness。价格估算约 2000 到 3000 美元一天,但正文没披露独立验证,这点先别太激动。

4月6日星期一

X · @dotey(宝玉)

小米罗福莉:Agent 时代算力跟不上 Token 烧法,出路不是降价而是省 Token

小米 MiMo 团队负责人罗福莉指出,现在 Agent 干活时反复带着超过 10 万 Token 的长上下文去调工具,请求次数是 Claude Code 自身框架的好几倍,真实 API 成本可能冲到订阅价的几十倍,全球算力根本扛不住。她认为短期阵痛反而是好事,第三方框架被 API 付费逼着去改进上下文管理、提高缓存命中率、砍掉无效消耗。同时她呼吁大模型...

推荐理由:小米 MiMo 负责人罗福莉这次发言没绕弯子,直接拿 OpenClaw 和 Claude Code 的请求次数做对比,把 Agent 多轮工具调用带来的 Token 消耗和成本膨胀讲得很清楚。10 万 Token 上下文反复携带、请求量高出数倍、API 计费后成本翻几十倍,这些数字让“算力跟不上”的判断有了抓手。正文没给具体定价方案,也没公开测试环境,所以结论先打个折,但方向对做推理优化和框架选型的人有参考价值。

4月4日星期六

X · @dotey(宝玉)

Anthropic 正式封堵订阅漏洞:Claude Pro/Max 不再给 OpenClaw 等第三方工具买单

Claude Code 负责人 Boris Cherny 发公告,太平洋时间 4 月 4 日中午起,Claude Pro 和 Max 订阅的额度不再覆盖通过 OpenClaw 这类第三方工具产生的用量。想继续在这些工具里用 Claude,要么买打折的用量包,要么用 API Key 按量付费。现有订阅用户会拿到一笔等于月费的一次性补偿,觉得不够的明天邮件...

推荐理由:这不是常规价格调整,是 Anthropic 在收紧第三方 Claude 套壳工具的账单和访问权限。HKR 三项都成立:冲突钩子够硬,截止时间和补偿方案具体,开发者圈子里反响会很大。不过影响范围比发新模型或改产品定位要窄,所以重要性没给更高。