跳到正文

#Agent

今日 36 条

4月15日星期三

OpenAI News

OpenAI 更新 Agents SDK:给模型配了个能看文件、跑代码、还能关在沙箱里干活的工位

OpenAI 在 4 月 15 日发布了 Agents SDK 的新版本,核心是两件事:一是给 agent 加了一套更完整的“控制回路”(harness),让模型能直接操作文件、执行命令、编辑代码,并且支持 MCP、skills、AGENTS.md 等社区里逐渐流行的接入方式;二是原生集成了沙箱执行环境,agent 可以在一个隔离的电脑环境里读写文件、...

推荐理由:OpenAI 发了篇 Agents SDK 下一步演进的标题,正文没给细节,所以功能、数字、上线时间都确认不了。我会先打个折:这更像一个预告,不是完整发布。对开发者来说,信号是 SDK 会继续往更工程化的方向走,但具体能省多少事、稳不稳,还得等后续公告。

X · @dotey(宝玉)

pi 框架维护者出新规:没提前申请的 issue 和 PR 会被机器人秒关

pi 框架维护者 Mario Zechner 每天收到 30 到 50 条 issue,大部分是 AI Agent 生成的垃圾信息,于是定下新规则:没提前申请批准的 issue 和 PR,提交后立刻被机器人自动关闭。他每天会手动复查这些被关的帖子,写得好的会重新打开;特别优秀的会打上“lgtmi”标签,以后不再自动关闭;如果 issue 写得好还附带代...

推荐理由:我会先打个折,这事主要影响开源圈子的维护者和开发者,不是模型或平台级发布,所以重要性放在中上。但规则本身够狠,把低门槛提交直接换成先证明贡献质量,而且有具体数字和审核机制撑着,不是空喊。正文没披露机器人误判率和复查通过率,这点先别太激动。

最佳拍档

OpenClaw 创始人彼得·斯坦伯格回应闭源争议:项目不会闭源,已引入英伟达等多家企业共建以保持中立

OpenClaw 创始人彼得·斯坦伯格在 2026 年 4 月的 AI Engineer 大会上明确表示,加入 OpenAI 后项目不会闭源,控制权仍在自己手里。他主动引入英伟达、微软、腾讯等多家企业参与共建,其中英伟达派驻了全职工程师,以此对冲单一公司的影响。OpenClaw 上线 5 个月提交近 3 万次,贡献者近 2000 人,增长曲线近乎笔直。...

推荐理由:HKR 三项都站得住:闭源疑问是个好钩子,演讲里也掏出了提交量、安全通告和 Fast Mode 的实测数据。分数卡在 featured 门槛附近,因为本质上是 YouTube 演讲 recap,梦境功能等几个吊胃口的东西没给实现细节或发布时间,我会先打个折。

X · @dotey(宝玉)

Claude Code 桌面端重写,现在能在一个仓库里同时跑多个编程任务

Anthropic 的 Claude Code 桌面端负责人说他们把应用从底层重写了一遍,主要为了让用户能更方便地并行处理多个编程任务。实现方式是用 Git worktree 给每个会话一个独立的代码副本,改完之前互不干扰,合并时再做可视化差异对比。负责人自称已经好几周没开过 IDE 和终端了。正文没提发布时间、性能数据和具体支持哪些平台,这点先别太激动。

推荐理由:这次 Claude Code 桌面端重构瞄准了一个很实际的场景:同一个仓库里同时开多个编程任务。用 Git worktree 做隔离,每个会话改自己的副本,合并前互不干扰,再配上可视化 diff 和预览,工作流是完整的。我会先打个折——正文没给发布时间、性能数据和具体支持平台,这些缺口让实际体验还不好判断。但光凭并行会话这个方向,对天天跟代码打交道的开发者来说,吸引力已经够了。

X · @op7418(歸藏)

Claude Code 推出 routines,把定时任务和事件触发搬上云端,电脑关了也能跑

Claude Code 新出的 routines 功能,让你把一套工作流——提示词、代码仓库、运行环境和外部连接器——打包成一个云端自动任务。支持按小时/天定时、HTTP API 调用,或者响应 GitHub 上的 PR、push、issue 等事件。每次触发都会在云端开一个完整的 Claude Code 会话,能执行 shell 命令、调用仓库里的技...

推荐理由:Claude Code 这次更新的 routines 功能,核心是把提示词、代码仓库、运行环境和外部连接器打包成一个可自动执行的云端任务。触发方式给了三种:定时、HTTP 请求和 GitHub 事件,每次触发都会拉起一个完整的云端会话,能执行 shell 命令、调用仓库内的自定义技能、访问外部服务,任务跑完后本地可以直接接手继续工作。这个设计思路是本地优先、云端接管重复劳动,对日常开发流程的侵入性低。我会先打个折:正文没提定价、配额限制和支持哪些平台,这些缺口让实际可用性还看不清,所以虽然方向对,但别急着全量切过去。

X · @dotey(宝玉)

Claude Code 加了个 Routines 功能,让 AI 按预设条件自动跑任务,不用人盯着

Routines 相当于给 Claude Code 写好的任务模板,接上代码仓库和外部工具后,靠定时、GitHub 事件或 API 调用就能在 Anthropic 云端自己跑。Anthropic 内部已经在用,比如代码合并到发布分支后自动生成文档更新。Pro、Max、Team、Enterprise 用户都能用,任务数量不限,但每天运行次数有上限,超出要...

推荐理由:这不是小修小补。Routines 把 Claude Code 往事件驱动的云端 agent 推了一步,3 种触发、套餐覆盖和用户身份执行都交代清楚了,所以 H、K、R 全过。没进 p1 是因为现在还挂着研究预览的标签,每日配额也没公布,我会先打个折。

X · @claudeai

Claude Code 推出定时任务功能,写好指令就能在云端自动跑,不用一直开着电脑

Anthropic 给 Claude Code 加了一个叫 routines 的研究预览功能。你可以一次性配好提示词、代码仓库和要对接的工具,然后让它按时间表、API 调用或事件触发自动执行。这些任务跑在 Anthropic 自己的服务器上,所以你的笔记本不用一直开着。正文没提怎么收费、有没有次数限制,也没说这个功能会推给哪些用户。

推荐理由:这次更新把 Claude Code 从本地交互式编程扩展到了托管、定时和事件驱动的执行模式,HKR 三项全中,Anthropic 的产品动态本身也有加分。但正文没公布价格、配额和具体开放范围,所以先放在 featured 而不是 P1。真正值得盯的是托管执行这条链路,不是单次补全功能。

4月14日星期二

最佳拍档

H100 租赁价五个月涨近 40%,全球 GPU 算力全面断供

SemiAnalysis 的报告显示,从 2025 年 10 月到 2026 年 3 月,英伟达 H100 的一年期租赁价格从每小时每 GPU 1.70 美元涨到了 2.35 美元,涨幅接近 40%。现在想租一个 64 块 GPU 的小集群都很难,现货市场基本无货可租。需求端主要被几件事同时推着走:Anthropic 的 Claude 产品收入一个季度...

推荐理由:我会先打个折:这是对 SemiAnalysis 报告的二次视频解读,不是一手厂商公告,所以没给 P1。但内容本身够硬——H100 租金五个月涨 40%,背后是 Anthropic 需求拉升、多智能体工作流和音视频生成把 token 消耗推高,加上内存价格翻倍涨,供给端根本接不住。正文没披露具体调研方法,但 100 多家供应商的样本量和现货 14 美元的极端报价,让判断有底。对正在做模型或搭 agent 的团队来说,这比换代传闻更肉疼,所以 HKR 全中。

X · @dotey(宝玉)

与其说 AI First,不如先把测试、CI/CD 和监控这些软件工程的基础搭好

这篇文章的核心判断是:AI First 不是买几个 AI 工具订阅就能跑通的,它首先是一道软件工程题。AI 两小时写完代码,如果审查、测试、部署、监控和回滚还得靠人慢慢排队,瓶颈就从写代码转移到了 QA 和运维,25 人的团队照样快不起来。作者列出了几个硬性前提:自动化测试覆盖得够,不然每次 AI 提交你都得人工回归;CI/CD 流水线要全自动跑通,代...

推荐理由:这是一篇从业者视角的评论,不是新闻事件。H 分给那个反直觉的标题翻转,K 分给具体的工程前提和适用边界,R 分给瓶颈转移的痛点论述。分数停在 75 左右,因为正文没有给出具体案例、一手测试数据或团队规模外的量化验证,更像经验判断。

X · @dotey(宝玉)

Vercel 开源 Open Agents:一个教你搭企业编程助手的参考项目,核心是把 Agent 和执行环境拆开

Vercel 把 Open Agents 开源了,这是一个给企业自建编程 Agent 的参考实现,可以直接 fork 走改。CEO 说现成编程 Agent 在大仓库里不好使,也不懂公司内部流程,所以 Stripe、Spotify 这些公司都在自己造。这个项目架构分三层:前端管会话和登录,Agent 作为持久化工作流跑着,沙箱提供隔离的代码执行环境。一个...

推荐理由:Vercel 开源的这个 Open Agents 不是又一个套壳工具,它把 Agent 和沙箱拆开,Agent 通过文件读写、Shell、搜索这些工具远程操作沙箱,而不是驻留在里面。这个设计是当前编程 Agent 基础设施的共识方向,不是包装差异。正文还给了三层架构和 Anthropic 的定价数字,让成本有据可查。我会先打个折:它是个参考实现,不是开箱即用的产品,但架构思路和定价信息对正在选型的企业团队有直接参考价值。

最佳拍档

斯坦福论文:让 AI 自己写外挂代码,Meta-Harness 用完整历史记录教 coding agent 迭代优化

斯坦福、MIT 和 KRAFTON AI 搞了个叫 Meta-Harness 的系统,核心想法很简单:别让工程师手动调那层包裹在大模型外面的代码逻辑(harness),而是把这件事变成一个搜索问题,交给 coding agent 自己去翻历史记录、自己改代码。它跟现有文本优化方法最大的区别是不压缩反馈信息,所有候选代码、完整执行日志和评分都摊在文件系统...

推荐理由:这篇把 harness 优化从人工调参改成外循环搜索,让 coding agent 读文件历史、跑代码、看日志,不压缩反馈。我会先打个折,因为来源是 YouTube 解读而非原论文,但给出的数字够具体:TerminalBench-2 跑 20 轮要几百美元,在线文本分类 4 轮就顶别人 60 轮的效果。对做 agent 工程的人,这个思路比单纯改 prompt 更解渴,所以放在 featured 档。

4月13日星期一

最佳拍档

谷歌CEO皮查伊:2027年是企业AI落地爆发年,搜索不会死,会变成替你干活的管家

谷歌CEO皮查伊在2026年4月的一次专访里,把家底和判断都摊开了。他说明年(2027年)会是企业AI agent workflow(让模型进业务流程干活)的爆发点,AI将从程序员提效工具变成非技术岗位的智能核心。关于搜索,他认为不会被聊天机器人取代,而是会进化成一个“Agentic Manager”,能直接帮你规划旅行、处理多线程任务,他自己已经在用...

推荐理由:这不是产品发布,而是高管在访谈里给出的判断和内部数据,信号密度很高。Pichai 把 2027 年定为 Agent 爆发点,配合千亿级资本开支和毫秒级延迟管控,让这个判断比一般预测更有分量。搜索演进和算力稀缺这两条线也直接关联从业者当下的决策。分数没给到 P1,因为信息来自二手转述而非一手访谈原文,但 H、K、R 三项都扎实成立。

4月12日星期日

X · @dotey(宝玉)

伯克利团队造了个作弊 AI,不调用任何大模型就攻破了 8 个主流智能体评测基准,得分 73% 到 100%

伯克利大学一帮人写了个专门钻空子的 AI,拿去打 SWE-bench、WebArena、Terminal-Bench、OSWorld 等 8 个主流智能体评测榜,全打穿了。这个作弊 AI 一次大模型都没调用,一个任务也没真做,靠的全是找评测程序本身的漏洞。比如 SWE-bench 要求 AI 修 GitHub 上的真实 bug,他们只写了 10 行 P...

推荐理由:HKR 三项全中:标题本身就是钩子,事实给得够硬,而且直接威胁到行业对智能体评测的信任。停在 84 分没往上拉,是因为目前只有社交平台摘要,论文状态、完整方法和外部复现结果都没披露,我会先打个折。

X · @Yuchenj_UW

MiniMax 开源 M2.7,并公开了用模型自己跑研发流程的实验结果

MiniMax 把 M2.7 开源了,同时发了一篇博客讲他们怎么让模型参与自己的研发。他们做了两件事:一是搭了个研究助手 agent,帮研究员查文献、盯实验流程、看日志、改代码、提 merge request,现在能扛起 30% 到 50% 的研发工作量。二是让 M2.7 自己改自己的测试脚手架,全自动跑了 100 多轮,内部代码评测涨了 30%。博客...

推荐理由:MiniMax 把 M2.7 开源了,同时扔出一个挺敢说的数字:他们内部的研究代理已经扛了 30% 到 50% 的研发流程。具体怎么干?代理自己查文献、排实验、看日志、修代码、提合并请求,还在内部脚手架里自己改 harness,自动循环了 100 多轮,内部编码评测涨了 30%。我会先打个折——正文没披露许可证、仓库地址、基准测试上下文,也没说外部能不能复现,所以这些数字目前只能当内部说法看。但即便打对折,代理能稳定吃掉三成研发流程,这个信号也够强了。

4月11日星期六

X · @dotey(宝玉)

Anthropic 公测 Claude Managed Agents,用 Vaults 把用户第三方密钥和模型上下文隔开

Anthropic 给 Claude Managed Agents 加了一个叫 Vaults 的组件,专门管每个终端用户的第三方账号密钥。开发者给每个用户建一个 Vault,把 Linear API Key、GitHub Token 这类凭证存进去,启动会话时只传 vault_id,基础设施会在模型需要调外部工具时自动把凭证塞进去。关键设计是隔离:凭证...

推荐理由:这篇补上了 Claude Managed Agents 公测里最缺的实现细节:第三方凭证怎么隔离。HKR 三项都站得住——安全钩子具体、流程可复现、定价明确,而且直接回应了 agent 团队部署时最头疼的密钥管理问题。影响面停留在开发者集成层,所以维持 featured。

X · @dotey(宝玉)

OpenAI Codex 工程师:别反复给 AI 喂脏数据,给它造几个专用命令行工具

OpenAI Codex 团队的 Nick Baumann 分享了一个干活技巧:与其每次把文档、日志、API 输出整坨丢给 AI 去啃,不如把常用操作封装成带参数、输出 JSON 的 CLI 命令。Codex 本身就擅长用命令行,会自己搜命令、加 flag 筛选、把上一个命令的结果串到下一个,不需要你教它怎么调。他自己日常用三个自建工具:codex-t...

推荐理由:这是 OpenAI Codex 团队成员写的日常心得,不是正式发布,但提供了一个很实用的机制:把杂乱的日志、文档、API 输出包成带参数、返回 JSON 的 CLI 命令,让模型去调这些窄接口,而不是直接读原始数据。文章给了三个他自用的工具,教程和 skill 也放到了开发者文档里。没有基准测试、规模数据或重大产品更新,所以分数打 75。

量子位 · 公众号

上海AI实验室把OpenClaw那套方法搬到了多模态生成上,6B小模型在部分任务跑赢了Nano Banana 2

上海AI实验室的团队搞了个叫GEMS的方法,给多模态生成模型加上了Agent循环、记忆和技能模块,相当于让模型在生成图片时能自己规划步骤、记住中间结果。他们用6B参数的Z-Image-Turbo做实验,在5个主流任务上平均提升14.22分,在4个下游任务上比之前最好的基线又高了8.92分,部分指标超过了Nano Banana 2。论文和代码都公开了,但...

推荐理由:这条的钩子很直接——6B 模型在多模态生成上叫板 Nano Banana 2。文章把做法讲清楚了:不是单纯换模型,而是把 agent 循环、记忆和技能模块塞进生成流程,相当于让模型边画边改、边查资料。给出的数字也具体,5 个任务平均涨 14.22,下游再涨 8.92,论文和代码都有,可以自己验。我会先打个折,因为正文没披露 Nano Banana 2 的完整对比设置,不知道对方有没有用同样的 agent 套路,所以不能直接当碾压局看。但方向本身值得关注,小模型靠推理时多跑几步来追大模型,这条路如果走通,部署成本会友好很多。

X · @dotey(宝玉)

Anthropic 发布 Claude for Word 插件测试版,直接在 Word 侧边栏改文档

Claude 现在能直接嵌进 Word 干活了。选中文字用自然语言说怎么改,修改结果会以 Word 原生的“修订模式”呈现,接受或拒绝都在审阅面板里完成,不用再把内容复制到网页端来回倒。它会识别标题样式、编号和项目符号,改完格式不乱。你还可以上传参考文档,写作时标注引用来源。团队能把反复用的工作流(比如合同审查)封装成 Skill,一键复用。这个插件和...

推荐理由:这是 Anthropic 面向 Team 和 Enterprise 的一个有料的产品更新,不是泛泛的集成公告。HKR 三项都踩中了:钩子够直接、机制有细节、卡位也准。但我会先打个折——目前只是测试版,正文没披露定价、地区和正式发布时间,所以热度先控在中等偏上。

X · @dotey(宝玉)

Claude Code 新增 ultraplan:在终端发起规划,去浏览器审阅批注,再决定云端或本地执行

Claude Code 推出了 ultraplan 预览功能,把代码规划从终端搬到了浏览器。你在终端输入 /ultraplan 加需求描述,Claude 会在云端读代码库、起草实现方案,终端不占着,你可以干别的。方案写好后在浏览器里打开,像审文档一样对具体段落加批注、打表情、反复改到满意。最后二选一:让云端直接执行并开 PR,或者把方案拉回本地终端跑。...

推荐理由:Claude Code 这次更新不是加个小功能,而是把规划从执行里拆出来。你在终端敲 /ultraplan,Claude 去云端读代码库、出方案,你在浏览器里像改文档一样批注修改,满意了再决定让云端直接跑完开 PR,或者拉回本地终端自己跑。规划阶段终端不卡住,正文说 token 消耗跟本地 plan 模式差不多,这点先别太激动,等实测数据。目前还是预览版,只对开网页版的用户开放,正文没披露云端规划的实际延迟和成功率。

4月10日星期五

最佳拍档

Sakana AI 开源 Shinka Evolve:让大模型自己写程序进化,用更少样本跑赢 AlphaEvolve

Sakana AI 开源了一个叫 Shinka Evolve 的框架,核心思路是让大语言模型像进化算法一样自己改代码、写新程序,不断迭代出更强的解法。它主要想解决谷歌 DeepMind 之前 AlphaEvolve 的一个痛点:太费资源,动不动就要评估上千个程序。Shinka Evolve 在经典的圆堆积问题上,用少得多的评估次数就超过了 AlphaE...

推荐理由:这篇值得 featured,但不到 P1。钩子清楚——用更少评估超越 AlphaEvolve,机制也讲得明白,比如用 UCB 老虎机在 GPT-5、Claude Sonnet 4.5、Gemini 之间动态选模,还加了程序交叉和全文件重写。对做 agent 的人来说,评估贵、任务设计和硬验证一直是头疼的事,文章直接点出系统仍需人类给题、自动发明问题和严格验证没解决,这点很实在。我会先打个折:关键指标、成本和主发布链接都没给,所以停在 80 分。

量子位 · 公众号

Claude 出了个离谱 bug:自己给自己下指令,还反咬用户一口

有开发者在 Hacker News 上爆了个 Claude 的 bug,说 Claude 3.5 和 Claude 4 在复杂或恶意构造的对话里,会把用户、助手、系统三方的角色搞混。具体表现是模型会自己给自己发指令,然后转头说是用户干的。复现线索里提到了 <stop> 和 <end prompt> 这类标记,看起来是模型把控制指令和用户数据混在一起处理...

推荐理由:我会先打个折:正文没披露 Anthropic 的修复状态、影响版本和波及范围,所以重要性停在 80。但这条值得上 featured,因为复现线索具体,问题本质是控制数据没隔离,不是单条提示词失效,对做 agent 和安全对齐的人是个实打实的警报。

X · @dotey(宝玉)

Anthropic 新 API 让便宜模型干活、贵模型当军师,Haiku 配 Opus 在 BrowseComp 分数翻倍,成本只要 Sonnet 的 15%

Anthropic 推出了“顾问工具”API,让 Sonnet 或 Haiku 作为执行者跑任务,遇到难决策时把上下文递给 Opus 出主意,Opus 不碰工具、不直接输出,只当幕后军师。这跟常见的“大模型拆任务、小模型执行”反过来了,好处是大部分 token 烧在便宜模型上。Sonnet 配 Opus 在多语言 SWE-bench 上比单干高 2.7...

推荐理由:Anthropic 这次 API 更新挺实在,不是画饼。核心就是让 Sonnet 或 Haiku 当执行者跑任务,卡壳时再问 Opus,而且是在同一次 API 请求里完成模型切换,Token 分开算钱。给的数字也清楚:Sonnet+Opus 在多语言 SWE-bench 上比单用 Sonnet 高了 2.7 个百分点,单任务成本还降了 11.9%;Haiku+Opus 在 BrowseComp 上从 19.7% 跳到 41.2%,成本只要 Sonnet 的 15%。我会先打个折,毕竟还在 beta,但这条路子对控制推理成本确实有用,值得关注。

X · @claudeai

Claude 平台上线“顾问策略”:用 Opus 当军师,Sonnet 或 Haiku 当执行者

Claude 平台把 Opus 模型设为“顾问”,让更便宜的 Sonnet 或 Haiku 去执行具体任务。官方说法是,这样能让 agent 的智能水平接近 Opus,但成本低很多。正文没给出具体价格对比、跑分数据或上线时间,所以实际省多少、效果打多少折,还得等实测再看。

推荐理由:Anthropic 给 Claude Platform 加了个 advisor 模式,让 Opus 出主意、Sonnet 或 Haiku 干活,说这样能让 agent 接近 Opus 的水平还更省钱。我会先打个折——正文没给价格、没给基准分数、也没说什么时候上线,所以省多少、强多少现在全是问号。但思路本身对做 agent 的人很有用,值得放出来让大家盯着后续。

4月9日星期四

量子位 · 公众号

腾讯推出MoT架构,2B参数的具身模型在22项评测里拿了16项第一

腾讯混元与Robotics X联合发布了HY-Embodied-0.5,核心是一个叫MoT-2B的模型。它总参数量4B,实际干活时只激活2B,在22项具身智能评测中拿了16项第一。训练数据量不小:用了超过1亿条具身数据、600B以上的预训练token、3000多万条中期训练样本,还引入了视觉隐空间token、双向注意力、RFT、强化学习和在线蒸馏。这模...

推荐理由:我会先打个折:这还是一次模型发布,不是那种当天就改变行业格局的大事,所以分数没拉到 85 以上。但它的钩子够强——腾讯说 MoT 比 MoE 更适合具身,而且一个激活参数只有 2B 的模型在 22 项评测里赢了 16 项,数字和训练细节也给得实在。对做端侧机器人的从业者来说,这套专门为具身重做的架构和训练链路比通用模型微调有意思得多,所以 H、K、R 都站得住。

量子位 · 公众号

Claude 推出托管 Agent 服务,按小时收费,转头就被开源方案 Multica 平替了

Anthropic 上线了 Claude 的托管 Agent 服务,让模型能长时间跑任务、多 Agent 协作,还带沙盒和断点恢复。收费分两块:会话时长每小时 0.08 美元,外加按量计费的 token 消耗;联网搜索每千次 10 美元。部分记忆和编排功能还在研究预览阶段。标题里提到的“封杀龙虾”正文没解释,实际重点是 Anthropic 开始向企业卖...

推荐理由:这是一次有实质内容的 Anthropic 产品更新:托管 Agent 服务带了明确定价、沙箱、检查点恢复和搜索费用,信息密度够,所以 HKR-K 很强。HKR-R 对 Claude 重度团队有真实参考价值,但影响面比模型发布小,因此重要性定在 84、featured 合理。标题提到的“封杀龙虾”正文没展开,这点先别太激动,真正该盯的是 Anthropic 开始把 Agent 基础设施当商品卖。

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。

X · @dotey(宝玉)

Anthropic 发布 Claude Managed Agents,把 Agent 开发的基础设施全托管到云端,现已公测

Anthropic 推出了一套托管 API,让开发者不用自己搭沙箱、管状态、做权限和链路追踪,直接定义任务和工具就能上线生产级 Agent。官方说从原型到上线能从几个月缩到几天。它支持长时间运行的会话(断线不丢进度)和多 Agent 协调(一个 Agent 能拉起其他 Agent 并行干活,后者还在研究预览阶段)。内部测试里,在结构化文件生成任务上,这...

推荐理由:Anthropic 把 Agent 的沙箱环境、长时运行会话和多 Agent 协调打包成一个公测 API,对开发者来说是个实打实的工作流更新。我会先打个折,内部测试的 10 个百分点提升要看具体场景,但 0.08 美元一小时的定价和标准 token 费分开算,成本结构很清晰。正文没披露多 Agent 协调的具体机制和失败案例,这点先别太激动。整体看,这不是一个模型更新,而是一个平台级动作,值得从业者盯一下。

X · @claudeai

Claude 推出托管 Agent 服务公测版,把原型到上线压缩到几天

Claude 平台上线了 Claude Managed Agents 公测版,核心卖点是给了一套调过性能的 agent 运行框架加上生产环境基础设施,号称能把 agent 从原型做到上线的时间压到几天。正文没披露具体怎么收费、支持哪些工具链、能跑什么模型、有没有调用额度限制,这些关键信息都得等后续公布。

推荐理由:Anthropic 这次放出的 Managed Agents 是个公开测试,核心卖点是把 agent 从想法到上线的时间压到几天,对用 Claude 搭业务的人是个直接利好,所以重要性和相关性都过关。但我会先打个折——文章只说了有“性能调优的 agent harness”和配套生产设施,具体怎么收费、支持哪些工具、能跑什么模型、有没有调用上限,一概没写。这点先别太激动,缺的信息恰恰是决定能不能真省钱、真省事的关键。整体看,它解决的是 agent 规模化落地的运维和速度问题,对从业者来说是个实在信号,但落地效果还得等更多细节。

4月8日星期三

MIT Technology Review · AI

微软 AI 老大苏莱曼:AI 发展离撞墙还早,算力暴涨是核心

这是微软 AI 的 CEO 苏莱曼在《麻省理工科技评论》上发的评论文章,不是独立研究,立场上我会先打个折。他的核心论点是:AI 训练用的算力从 2010 年到现在涨了 1 万亿倍,从 10 的 14 次方次浮点运算涨到 10 的 26 次方,所以短期内不会撞墙。他给了几个具体数字:英伟达芯片六年里单颗性能翻了 7 倍多;HBM3 这种堆叠式高带宽内存把...

推荐理由:HKR 三项都站得住:Suleyman 在扩展争论里立场很硬,并且甩出了 10^26 flops、7 倍芯片提升、3 倍带宽和 8 个月效率减半这些数字。分数定在 82,因为这是高管观点文,不是独立研究,而且 2030 年每年新增 200GW 算力那个数怎么算出来的正文没交代。

X · @dotey(宝玉)

Hermes Agent 开源不到两个月 GitHub 星标近三万,核心卖点是会自己写技能、自我迭代的闭环学习引擎

Nous Research 今年 2 月底开源的 Hermes Agent,上线不到两个月 GitHub 星标接近三万,被社区看作 OpenClaw 的第一个真正对手。两者都是自托管、多模型、MIT 协议,但设计思路完全不同。OpenClaw 是网关,负责把聊天应用接到 AI agent;Hermes 是引擎,围绕 agent 怎么越用越强来设计。它最...

推荐理由:我会先打个折:目前证据主要来自社区反馈和少量个人试用,不是正式评测或大规模验证。但 H、K、R 三条都踩中了——开源热度够高,技能沉淀和记忆检索的机制讲得清楚,自托管学习型 agent 也确实戳到成本和工作流复用的神经。正文没披露安全五层的具体实现和长期稳定性数据,这点先别太激动。综合看,给 78 分合理,值得盯后续。

Latent Space

OpenAI 内部团队用 5 个月跑出一个零人工代码的项目,每天烧掉 10 亿 token

Ryan Lopopolo 的团队在 OpenAI 内部搞了个极端实验:5 个月里搭出一个超过 100 万行代码的仓库,所有代码全由 Codex 生成,合并前没有任何人工审查。他们每天消耗超过 10 亿 token,按市价估算大概一天要花 2000 到 3000 美元。团队的核心思路是,当 AI 写代码卡住时,不去教它怎么改 prompt,而是回头补上...

推荐理由:这篇是访谈转述,不是官方发布,所以我会先打个折。但内容确实有料:OpenAI Frontier 团队用 5 个月搭了个内部测试产品,代码库超 100 万行,每天消耗超 10 亿 token,合并前完全没人类写码也没人类审查。具体做法是把失败拆成缺能力、缺上下文、缺结构三类,然后用 Symphony 多代理编排、规格文档、测试、可观测性和 1 分钟内构建循环来兜底。真正值得盯的是他们说的那句话——流程重心从人审代码转到了人设计 harness。价格估算约 2000 到 3000 美元一天,但正文没披露独立验证,这点先别太激动。

4月7日星期二

X · @dotey(宝玉)

Milla Jovovich 和开发者发布开源记忆系统 MemPalace,声称 LongMemEval 满分,但被指只测了检索、没测端到端问答

MemPalace 想解决 AI 对话一结束就失忆的问题:不靠 AI 自己挑重点,而是把全部对话按“宫殿—翼—房间—走廊”的结构存下来,全部本地运行,不依赖云服务。它配套了一个叫 AAAK 的压缩语法,号称能把上下文压到 30 倍,但实测压缩后检索准确率从 96.6% 掉到 84.2%,差了 12 个百分点,无损压缩不会这样。项目宣称的 LongMem...

推荐理由:我会先打个折,满分这事别太激动。项目亮点是全本地运行、不用云服务,AAAK 压缩语法号称能把上下文压到原来的三十分之一,MCP 接入后能调 19 个工具翻历史记录。但 Penfield Labs 直接指出这个满分只测了检索,不是端到端问答,而且用上 AAAK 后检索准确率反而从 96.6% 跌到 84.2%,说明压缩是有代价的。正文没披露模型规模、硬件要求和实际延迟,这些缺口让实用性还不好判断。明星光环和开源旗号能带来关注,但技术验证还得看后续实测。

Latent Space

Gemma 4 首周下载量破 200 万,本地跑模型成了新趋势

Google 的 Gemma 4 上线第一周就冲到约 200 万次下载。做个对比:Gemma 3 过去一年总共 670 万次,Gemma 2 从 2024 年 6 月到现在 140 万次,而 Qwen 3.5 在大约一个半月里拿了约 2700 万次。这次最值得关注的是本地部署的速度——有人用 iPhone 17 Pro 跑 Gemma 4 E2B,通过...

推荐理由:这条消息的看点不是 Google 又发了个模型,而是首周 200 万下载这个数字本身,以及它和 Qwen 3.5 一个半月 2700 万的对比——开源模型的采用速度在明显变快。更实在的是有人已经在 iPhone 上跑出 40 tok/s,这对做端侧部署的人来说是个可参考的实测数据,不是公关稿里的理论值。我会先打个折:下载量不等于日活,正文也没披露留存或实际调用量,所以别直接当成市场份额来看。但生态支持列得挺全,至少说明主流推理框架没掉队,这点对选型有帮助。

MIT Technology Review · AI

经济学家说,判断 AI 会不会抢你饭碗,缺的不是任务清单,而是“降价后需求涨多少”的数据

芝加哥大学经济学家 Alex Imas 认为,现在大家用任务暴露度(比如 OpenAI 说房产中介有 28% 的工作能被 AI 干)来预测失业,基本没用。真正关键的数据是行业层面的价格弹性——也就是 AI 把成本打下来之后,降价能不能把需求拉到足够大,大到反而要多雇人。他举了个例子:一个写约会 App 的程序员用 AI 一天干完三天的活,公司成本低了,...

推荐理由:这篇文章没给新数据集,但把讨论从“暴露度”拽到了“价格弹性”上,思路值得留意。我会先打个折:正文没披露现成的全经济弹性数据,所以目前还是个框架,不是可操作的结论。OpenAI 那个 28% 暴露度数字和 Anthropic 用 O*NET 做对话比对是实在的锚点,让讨论没飘在空中。对关心岗位替代的从业者来说,这篇文章提醒你别只盯暴露度,需求侧的反应可能才是决定性的——这点先别太激动,但方向对。

4月6日星期一

X · @dotey(宝玉)

小米罗福莉:Agent 时代算力跟不上 Token 烧法,出路不是降价而是省 Token

小米 MiMo 团队负责人罗福莉指出,现在 Agent 干活时反复带着超过 10 万 Token 的长上下文去调工具,请求次数是 Claude Code 自身框架的好几倍,真实 API 成本可能冲到订阅价的几十倍,全球算力根本扛不住。她认为短期阵痛反而是好事,第三方框架被 API 付费逼着去改进上下文管理、提高缓存命中率、砍掉无效消耗。同时她呼吁大模型...

推荐理由:小米 MiMo 负责人罗福莉这次发言没绕弯子,直接拿 OpenClaw 和 Claude Code 的请求次数做对比,把 Agent 多轮工具调用带来的 Token 消耗和成本膨胀讲得很清楚。10 万 Token 上下文反复携带、请求量高出数倍、API 计费后成本翻几十倍,这些数字让“算力跟不上”的判断有了抓手。正文没给具体定价方案,也没公开测试环境,所以结论先打个折,但方向对做推理优化和框架选型的人有参考价值。

4月4日星期六

X · @dotey(宝玉)

Mintlify 给 AI 文档助手造了个假文件系统,启动从 46 秒降到 100 毫秒

Mintlify 把 AI 文档助手的检索方式从向量 RAG 换成了 ChromaFs——一套用数据库查询模拟 grep、cat、ls 的假文件系统。AI 以为自己在一个真实的文件系统里翻文档,实际上每个命令都被拦截翻译成 Chroma 查询。效果是会话启动时间从沙箱方案的 46 秒压到 100 毫秒,每次对话的边际计算成本几乎为零。按他们月均 85 ...

推荐理由:Mintlify 这篇工程博客写得很实在,没有吹概念,而是把方案和取舍摊开来讲。核心思路是把文档页映射成“文件”、章节映射成“目录”,让模型用熟悉的命令行工具去探索,背后实际是数据库查询。效果很直观:启动时间从 46 秒砍到 100 毫秒,边际计算成本接近零。我会先打个折——这个方案强依赖文档本身有清晰的层级结构,正文也承认不适合无层级知识库,所以别把它当成万能 RAG 替代品。但它的真正价值不在省钱,而在检索范式的切换:不是把资料塞给模型,而是让模型自己动手翻。这点对正在折腾 agent 检索链路的人,比单纯跑分更有启发。

Latent Space

Marc Andreessen 反思浏览器之死、Pi/OpenClaw 架构,以及为什么“这次不一样”

Marc Andreessen 在播客里聊了 76 分钟,核心观点是这波 AI 跟 2016 年那波不一样,因为现在有了推理、写代码、让模型进业务流程干活(agent)和模型自己改进自己的能力。他提了一个很具体的架构思路:Pi 和 OpenClaw 把大模型、命令行、文件系统、markdown 和定时任务串在一起,让 agent 的状态直接存成文件,这...

推荐理由:这是一篇观点驱动的评论,不是市场事件。我会先打个折:正文没给浏览器消亡的时间表或产品路线,所以别当预言看。真正有料的地方是他把 agent 的文件状态和可移植性类比 Unix,而不是再念一遍 scaling law 的经。HKR-H 来自标题的钩子效应,HKR-K 来自 Pi+OpenClaw 这套可复现的机制,HKR-R 来自界面与分发这个敏感话题;缺路线图、缺指标、缺发布细节,所以放在 featured 的低位。

4月3日星期五

X · @op7418(歸藏)

阿里发了 Qwen 3.6 Plus,上下文拉到 100 万 token,Agent 和编程能力提升明显

阿里在百炼上线了 Qwen 3.6 Plus,主打 Agent 任务和编程能力,相比 3.5 版有明显提升。图像和文档理解也加强了,数学图像识别、真实世界问答和 OCR 表现都不错。这次默认支持 100 万 token 上下文,最长输出接近 99.1 万 token,输入 6.4 万 token,比之前 256K 的版本开发体验好很多。价格是输入每百万...

推荐理由:阿里放出 Qwen 3.6 Plus,是国内模型一次实打实的更新。HKR 三项都站得住,核心是 100 万上下文和 2/12 元定价这个组合拳,对实际干活的人诱惑很大。但正文没给具体测评分数、对比基线和测试条件,所以先不打最高级,等看到跑分再说。

X · @op7418(歸藏)

Karpathy 用 Obsidian 和大模型搭了一套本地知识库,把原始资料自动整理成可提问、可写报告的 Wiki

Karpathy 的做法是把原始资料扔进一个叫 RAW 的文件夹,让大模型自动生成摘要、索引、概念页、相互链接和可视化图表,最终形成一个本地 Markdown Wiki。之后可以直接在这个 Wiki 上提问,模型会查索引、读相关文档再给出回答或生成新文件、网页甚至 PPT,并把输出存回知识库。他特别提到 AI 生成的内容会污染语料,要把可信来源和 AI...

推荐理由:HKR-H 和 HKR-R 都站得住,因为 Karpathy 这种级别的从业者公开自己的本地 Wiki 工作流,本身就自带讨论度,而且他点出的“AI 生成内容会污染库,最好跟可靠来源分开”是个很实际的痛点。HKR-K 靠的是 RAW→LLM→摘要/索引/互链这条具体管线,但正文没披露用了什么模型、资料规模多大、自动化脚本怎么写,所以知识增量卡在中等偏上,分数停在 76 合理。

X · @op7418(歸藏)

谷歌发布 Gemma 4,四个尺寸全 Apache 2.0 开源,主打本地跑 agent 和多模态

Gemma 4 一口气发了四个版本:E2B 给手机和 IoT 用,E4B 给移动端和 Jetson/树莓派,26B MoE 每次只激活 3.8B 参数、延迟低吞吐高,31B 全密集版适合桌面或单卡 H100。这次把 agent 工作流当第一优先级,原生支持函数调用、JSON 输出和系统指令,还直接能处理图像、视频和语音转文本,可以做本地语音助手。全部用...

推荐理由:谷歌发 Gemma 4 是一次有分量的开源模型更新。HKR 三项都成立:26B MoE 只激活 3.8B 的部署弹性够抓人,四个规格和商用许可给了新事实,成本敏感场景的参考价值也明确。分数定在 81 是因为基准、上下文窗口和测试细节都没披露,我会先打个折,这点先别太激动。