跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1301–1320 条 · 共 1,465 条

4月16日星期四

Hacker News 首页

他们签了三年租约,把旧金山一家实体店完全交给 AI 去赚钱

Andon Labs 在旧金山 Cow Hollow 租下一间店面,签了三年租约,交给一个叫 Luna 的 AI 全权经营,目标就是盈利。Luna 没有实体,所以它自己招人:5 分钟内就在 LinkedIn、Indeed 和 Craigslist 上发了招聘帖,最后雇了两名全职店员,还通过 Yelp 找了油漆工和装修师傅。店里的选品、定价、营业时间、品...

推荐理由:HKR 三项都站得住:真租约、真门店,故事性强;招聘和工具细节有,但财务数据缺失,信息有缺口;AI 管人这个点直接戳到行业神经。不过这是公司自己发的帖子,盈利没公布,先别太激动,放 featured 比 P1 更合适。

X · @op7418(歸藏)

Anthropic 发了 Claude Opus 4.7,加了自我验证和更细的视觉能力,价格没涨

Claude Opus 4.7 已经在所有产品和 API 上线,价格跟 Opus 4.6 一样。这次主要让模型能干更长时间的活,指令跟得更紧,汇报前会自己先检查一遍输出,减少人工盯着。视觉方面能看清长边最长 2,576 像素的图,比之前精细不少。Claude Code 里多了个 Ultra Review 命令专门做审查,思考等级加了 xhigh 档位,...

推荐理由:Anthropic 这次把 Opus 4.7 铺到了所有 Claude 产品和 API 上,价格没变,这点先别太激动,但确实降低了升级门槛。正文列出的更新比较实在:长任务处理更稳、指令执行更准、输出前会自己检查一遍,相当于模型多了个校对环节。视觉输入把长边限制提到了 2,576 像素,能塞进更清晰的图。配套的 Claude Code 加了 Ultra Review 命令和 xhigh 思考等级,Max 用户还能开自动审批,适合把模型放进业务流程里跑。整体看,这是一次偏可靠性和工作流适配的更新,没有吹新 benchmark,但信息量够,对从业者有参考价值。

X · @claudeai

Claude 发布 Opus 4.7,称是其最强 Opus 模型,主打长任务更稳、指令跟得更准、回复前会自己检查一遍

Anthropic 在 X 上发了条推文,说 Opus 4.7 是他们目前最能打的 Opus 模型。推文提了三个点:跑长任务时更严谨,不会半路掉链子;对指令的理解和执行更精准;输出结果前会先自我验证一轮,相当于自己先审一遍再交差。意思是你可以把最难搞的活丢给它,少盯几眼。不过正文没给任何跑分、上下文窗口多大、怎么收费、哪些人能用到,这些关键信息全都没提...

推荐理由:这是一次有分量的模型发布,HKR 三项都站得住:新 Opus 本身就有话题性,三条改进可以实测验证,Claude 重度用户会立刻上手对比。分数没给更高,是因为正文没放基准分数、上下文长度、价格和上线范围,这些关键信息缺了,实际能省多少成本、延迟高不高都还说不准。

Hacker News 首页

通义千问开源 Qwen3.6-35B-A3B:总参数 350 亿,每次推理只激活 30 亿,主打编程智能体

Qwen 放出了一个新开源模型 Qwen3.6-35B-A3B,用的是混合专家架构,总参数量 350 亿,但实际干活时只调用 30 亿参数,跑起来很省资源。它的核心卖点是编程智能体能力,在 SWE-bench Verified 上拿了 73.4 分,Terminal-Bench 2.0 上 51.5 分,直接超过了自家上一代 270 亿参数的密集模型 ...

推荐理由:这是 Qwen 正经发模型,不是套壳功能更新。HKR 三条全中:低激活参数做代理编程是钩子,基准分数给了具体数字,开源权重加 30 亿激活直接戳部署成本和竞争焦虑。没给 p1 是因为目前只有一篇博客,还没看到第三方复现和更多消融实验。

Ben's Bites

Ben 的上下文清理小抄:别让 AI 被垃圾信息喂饱

Ben 在飞往旧金山的航班上没网,临时下载了 Gemma 4 26B 模型离线干活,顺便分享了他管理 AI 上下文窗口的几条硬经验。核心观点是:别迷信 100 万 token 的超长窗口,他根本不信任那种窗口下的稳定记忆,任务所需的完美回忆不该超过 15 万 token。他建议在上下文用量达到 60% 左右就收手,因为网页搜索会塞进大量你来不及看的 A...

推荐理由:这是一份个人工作流笔记,不是产品发布或论文,但给出的 60% 上下文红线和对 1M token 记忆的不信任,对天天跟 agent 打交道的人有直接参考价值。我会先打个折:正文没披露这些数字背后的系统测试,更像经验之谈,但胜在具体、可验证。污染链条那段提醒很实在,长上下文不是越大越好,垃圾进去只会放大。

Latent Space

GitHub 首次允许开源仓库禁用 Pull Request,AI 编程正在淘汰这套用了 21 年的协作流程

GitHub 最近悄悄上线了一个新选项:开源仓库可以彻底关掉 Pull Request 功能了。这是 PR 诞生 21 年来的头一遭。文章把这看作一个信号——AI 写代码的 workflow 已经变了,人和人之间那套基于 Git 的协作方式,可能不再适合 agent 之间打交道。Pete Steinberger 等人早就公开说过只想要 Prompt R...

推荐理由:这不是 GitHub 的官方公告,但它把一个具体改动——开源仓库可以关掉 PR——变成了对 agent 编码工作流的直接提问。我会先打个折:正文没披露有多少仓库实际用了这个设置,也没给出 agent 提交的规模数据,所以判断只能停在“信号”层面。不过它把 OpenAI Agents SDK、Cloudflare 等新 agent 栈和“提示提交”、沙箱执行串在一起,指向一个真问题:Git 工作流还能不能接住 agent 协作。这点先别太激动,但值得盯。

X · @dotey(宝玉)

模型不是笨,是 Harness 没配好

若石的博客把多步智能体跑崩的锅从模型身上拿开,扣在了工程约束没跟上。文章提出 Harness Engineering 四个原则:能用代码约束就别靠模型自觉,比如 JSON 输出直接上 Schema 校验,非法就回炉;关键状态外置到 state.json,崩了重启还能接着跑;验收必须交给独立的 Evaluator 模型或真执行一下,别让模型自评;失败要局...

推荐理由:这篇是转述若石的博客,没有披露成功率提升的具体数字,我会先打个折。但它的判断很直接:agent 多步任务老翻车,问题出在 Harness 没配好,不是模型不行。给出的 70% 上下文阈值、日志压缩、状态外置和 Schema 重试都是可落地的工程动作,对正在调 agent 的人有参考价值。

最佳拍档

Demis Hassabis 罕见袒露心声:AGI 应在实验室多沉淀十年,后 AGI 时代五十年内或成真

DeepMind CEO Demis Hassabis 在这场访谈里没怎么画饼,反而直说现在的 AI 发展节奏被商业和地缘政治推得太快,不是他理想的路子。他个人的想法是,把 AGI 相关技术在实验室里像欧洲核子研究中心那样再打磨十到二十年,每一步都彻底搞懂再往前走。他举了 AlphaFold 的例子,当初团队本打算按传统方式搭服务器让科学家排队提交任务...

推荐理由:这篇是访谈的二次整理,不是模型发布或政策文件,所以分数没拉满。但 Demis 的时间线判断、实验室沉淀主张、300 万用户和近 20 条药物管线的数据,以及他点名 2 到 4 年内的两类风险,信息密度够高,对从业者判断行业节奏和安全优先级有参考价值。

X · @dotey(宝玉)

OpenAI Agents SDK 加了内置沙箱和原生执行框架,TypeScript 版还在开发

OpenAI 给自家 Agents SDK 塞进了一个内置沙箱,Agent 可以直接在里面读写文件、跑代码、装依赖、保存状态,不用开发者自己搭环境。沙箱支持 Cloudflare、Vercel、Modal 等云厂商,也能接自己的方案。另一个更新是 Harness 架构,把状态存外面、计算跑里面,容器崩了能捡起来接着跑,不用重来,也能防提示注入导致凭证泄...

推荐理由:OpenAI 把 Agents SDK 从玩具级推到可上生产的级别,核心是两件事:内置沙箱让 agent 能安全跑代码和装东西,Harness 把执行和状态拆开,容器挂了任务还能接着跑。对做 agent 的团队来说,这省了自己搭隔离环境和写恢复逻辑的功夫。TypeScript 支持还在开发,正文没给时间,这点先别太激动。整体是工具链的扎实升级,不是概念发布,所以放 featured。

Dwarkesh Patel 访谈

黄仁勋谈英伟达护城河:不是芯片设计,是把电子变成 token 的那一整条供应链

黄仁勋把英伟达的生意概括成一句话:输入电子,输出 token,中间是英伟达。他认为护城河不在某颗芯片的设计,而在于把电子变成有价值的 token 这件事本身极其复杂,涉及大量科学和工程,短期内很难被商品化。他举了两个具体机制:一是上游的显性和隐性采购承诺,财报里披露了近 1000 亿美元的承诺,SemiAnalysis 估算实际规模可能到 2500 亿...

推荐理由:黄仁勋亲自下场解释护城河,不是讲芯片设计,而是讲从电子到 token 的全栈优化和上下游组织能力。文章给出了接近 1000 亿美元的采购承诺数字,SemiAnalysis 还报过 2500 亿的可能,上游用大额显性和隐性承诺锁晶圆、HBM 和封装,下游把模型方、整机厂和开发者拉进同一个生态。他还提到 agent 数量会指数增长,工具软件实例跟着涨。这些判断直接打在算力成本、供应安全和生态依赖上,对从业者判断供应链和选型有参考价值。不过正文没给出 2500 亿的具体来源和验证方式,这点先别太激动。整体是强观点评论,不是新品发布、财报或研究论文,所以分...

4月15日星期三

OpenAI News

OpenAI 更新 Agents SDK:给模型配了个能看文件、跑代码、还能关在沙箱里干活的工位

OpenAI 在 4 月 15 日发布了 Agents SDK 的新版本,核心是两件事:一是给 agent 加了一套更完整的“控制回路”(harness),让模型能直接操作文件、执行命令、编辑代码,并且支持 MCP、skills、AGENTS.md 等社区里逐渐流行的接入方式;二是原生集成了沙箱执行环境,agent 可以在一个隔离的电脑环境里读写文件、...

推荐理由:OpenAI 发了篇 Agents SDK 下一步演进的标题,正文没给细节,所以功能、数字、上线时间都确认不了。我会先打个折:这更像一个预告,不是完整发布。对开发者来说,信号是 SDK 会继续往更工程化的方向走,但具体能省多少事、稳不稳,还得等后续公告。

X · @dotey(宝玉)

pi 框架维护者出新规:没提前申请的 issue 和 PR 会被机器人秒关

pi 框架维护者 Mario Zechner 每天收到 30 到 50 条 issue,大部分是 AI Agent 生成的垃圾信息,于是定下新规则:没提前申请批准的 issue 和 PR,提交后立刻被机器人自动关闭。他每天会手动复查这些被关的帖子,写得好的会重新打开;特别优秀的会打上“lgtmi”标签,以后不再自动关闭;如果 issue 写得好还附带代...

推荐理由:我会先打个折,这事主要影响开源圈子的维护者和开发者,不是模型或平台级发布,所以重要性放在中上。但规则本身够狠,把低门槛提交直接换成先证明贡献质量,而且有具体数字和审核机制撑着,不是空喊。正文没披露机器人误判率和复查通过率,这点先别太激动。

最佳拍档

OpenClaw 创始人彼得·斯坦伯格回应闭源争议:项目不会闭源,已引入英伟达等多家企业共建以保持中立

OpenClaw 创始人彼得·斯坦伯格在 2026 年 4 月的 AI Engineer 大会上明确表示,加入 OpenAI 后项目不会闭源,控制权仍在自己手里。他主动引入英伟达、微软、腾讯等多家企业参与共建,其中英伟达派驻了全职工程师,以此对冲单一公司的影响。OpenClaw 上线 5 个月提交近 3 万次,贡献者近 2000 人,增长曲线近乎笔直。...

推荐理由:HKR 三项都站得住:闭源疑问是个好钩子,演讲里也掏出了提交量、安全通告和 Fast Mode 的实测数据。分数卡在 featured 门槛附近,因为本质上是 YouTube 演讲 recap,梦境功能等几个吊胃口的东西没给实现细节或发布时间,我会先打个折。

X · @dotey(宝玉)

Claude Code 桌面端重写,现在能在一个仓库里同时跑多个编程任务

Anthropic 的 Claude Code 桌面端负责人说他们把应用从底层重写了一遍,主要为了让用户能更方便地并行处理多个编程任务。实现方式是用 Git worktree 给每个会话一个独立的代码副本,改完之前互不干扰,合并时再做可视化差异对比。负责人自称已经好几周没开过 IDE 和终端了。正文没提发布时间、性能数据和具体支持哪些平台,这点先别太激动。

推荐理由:这次 Claude Code 桌面端重构瞄准了一个很实际的场景:同一个仓库里同时开多个编程任务。用 Git worktree 做隔离,每个会话改自己的副本,合并前互不干扰,再配上可视化 diff 和预览,工作流是完整的。我会先打个折——正文没给发布时间、性能数据和具体支持平台,这些缺口让实际体验还不好判断。但光凭并行会话这个方向,对天天跟代码打交道的开发者来说,吸引力已经够了。

X · @op7418(歸藏)

Claude Code 推出 routines,把定时任务和事件触发搬上云端,电脑关了也能跑

Claude Code 新出的 routines 功能,让你把一套工作流——提示词、代码仓库、运行环境和外部连接器——打包成一个云端自动任务。支持按小时/天定时、HTTP API 调用,或者响应 GitHub 上的 PR、push、issue 等事件。每次触发都会在云端开一个完整的 Claude Code 会话,能执行 shell 命令、调用仓库里的技...

推荐理由:Claude Code 这次更新的 routines 功能,核心是把提示词、代码仓库、运行环境和外部连接器打包成一个可自动执行的云端任务。触发方式给了三种:定时、HTTP 请求和 GitHub 事件,每次触发都会拉起一个完整的云端会话,能执行 shell 命令、调用仓库内的自定义技能、访问外部服务,任务跑完后本地可以直接接手继续工作。这个设计思路是本地优先、云端接管重复劳动,对日常开发流程的侵入性低。我会先打个折:正文没提定价、配额限制和支持哪些平台,这些缺口让实际可用性还看不清,所以虽然方向对,但别急着全量切过去。

X · @dotey(宝玉)

Claude Code 加了个 Routines 功能,让 AI 按预设条件自动跑任务,不用人盯着

Routines 相当于给 Claude Code 写好的任务模板,接上代码仓库和外部工具后,靠定时、GitHub 事件或 API 调用就能在 Anthropic 云端自己跑。Anthropic 内部已经在用,比如代码合并到发布分支后自动生成文档更新。Pro、Max、Team、Enterprise 用户都能用,任务数量不限,但每天运行次数有上限,超出要...

推荐理由:这不是小修小补。Routines 把 Claude Code 往事件驱动的云端 agent 推了一步,3 种触发、套餐覆盖和用户身份执行都交代清楚了,所以 H、K、R 全过。没进 p1 是因为现在还挂着研究预览的标签,每日配额也没公布,我会先打个折。

X · @claudeai

Claude Code 推出定时任务功能,写好指令就能在云端自动跑,不用一直开着电脑

Anthropic 给 Claude Code 加了一个叫 routines 的研究预览功能。你可以一次性配好提示词、代码仓库和要对接的工具,然后让它按时间表、API 调用或事件触发自动执行。这些任务跑在 Anthropic 自己的服务器上,所以你的笔记本不用一直开着。正文没提怎么收费、有没有次数限制,也没说这个功能会推给哪些用户。

推荐理由:这次更新把 Claude Code 从本地交互式编程扩展到了托管、定时和事件驱动的执行模式,HKR 三项全中,Anthropic 的产品动态本身也有加分。但正文没公布价格、配额和具体开放范围,所以先放在 featured 而不是 P1。真正值得盯的是托管执行这条链路,不是单次补全功能。

4月14日星期二

最佳拍档

H100 租赁价五个月涨近 40%,全球 GPU 算力全面断供

SemiAnalysis 的报告显示,从 2025 年 10 月到 2026 年 3 月,英伟达 H100 的一年期租赁价格从每小时每 GPU 1.70 美元涨到了 2.35 美元,涨幅接近 40%。现在想租一个 64 块 GPU 的小集群都很难,现货市场基本无货可租。需求端主要被几件事同时推着走:Anthropic 的 Claude 产品收入一个季度...

推荐理由:我会先打个折:这是对 SemiAnalysis 报告的二次视频解读,不是一手厂商公告,所以没给 P1。但内容本身够硬——H100 租金五个月涨 40%,背后是 Anthropic 需求拉升、多智能体工作流和音视频生成把 token 消耗推高,加上内存价格翻倍涨,供给端根本接不住。正文没披露具体调研方法,但 100 多家供应商的样本量和现货 14 美元的极端报价,让判断有底。对正在做模型或搭 agent 的团队来说,这比换代传闻更肉疼,所以 HKR 全中。

X · @dotey(宝玉)

与其说 AI First,不如先把测试、CI/CD 和监控这些软件工程的基础搭好

这篇文章的核心判断是:AI First 不是买几个 AI 工具订阅就能跑通的,它首先是一道软件工程题。AI 两小时写完代码,如果审查、测试、部署、监控和回滚还得靠人慢慢排队,瓶颈就从写代码转移到了 QA 和运维,25 人的团队照样快不起来。作者列出了几个硬性前提:自动化测试覆盖得够,不然每次 AI 提交你都得人工回归;CI/CD 流水线要全自动跑通,代...

推荐理由:这是一篇从业者视角的评论,不是新闻事件。H 分给那个反直觉的标题翻转,K 分给具体的工程前提和适用边界,R 分给瓶颈转移的痛点论述。分数停在 75 左右,因为正文没有给出具体案例、一手测试数据或团队规模外的量化验证,更像经验判断。

X · @dotey(宝玉)

Vercel 开源 Open Agents:一个教你搭企业编程助手的参考项目,核心是把 Agent 和执行环境拆开

Vercel 把 Open Agents 开源了,这是一个给企业自建编程 Agent 的参考实现,可以直接 fork 走改。CEO 说现成编程 Agent 在大仓库里不好使,也不懂公司内部流程,所以 Stripe、Spotify 这些公司都在自己造。这个项目架构分三层:前端管会话和登录,Agent 作为持久化工作流跑着,沙箱提供隔离的代码执行环境。一个...

推荐理由:Vercel 开源的这个 Open Agents 不是又一个套壳工具,它把 Agent 和沙箱拆开,Agent 通过文件读写、Shell、搜索这些工具远程操作沙箱,而不是驻留在里面。这个设计是当前编程 Agent 基础设施的共识方向,不是包装差异。正文还给了三层架构和 Anthropic 的定价数字,让成本有据可查。我会先打个折:它是个参考实现,不是开箱即用的产品,但架构思路和定价信息对正在选型的企业团队有直接参考价值。