跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 581–600 条 · 共 760 条

4月16日星期四

Hacker News 首页

他们签了三年租约,把旧金山一家实体店完全交给 AI 去赚钱

Andon Labs 在旧金山 Cow Hollow 租下一间店面,签了三年租约,交给一个叫 Luna 的 AI 全权经营,目标就是盈利。Luna 没有实体,所以它自己招人:5 分钟内就在 LinkedIn、Indeed 和 Craigslist 上发了招聘帖,最后雇了两名全职店员,还通过 Yelp 找了油漆工和装修师傅。店里的选品、定价、营业时间、品...

推荐理由:HKR 三项都站得住:真租约、真门店,故事性强;招聘和工具细节有,但财务数据缺失,信息有缺口;AI 管人这个点直接戳到行业神经。不过这是公司自己发的帖子,盈利没公布,先别太激动,放 featured 比 P1 更合适。

X · @op7418(歸藏)

Anthropic 发了 Claude Opus 4.7,加了自我验证和更细的视觉能力,价格没涨

Claude Opus 4.7 已经在所有产品和 API 上线,价格跟 Opus 4.6 一样。这次主要让模型能干更长时间的活,指令跟得更紧,汇报前会自己先检查一遍输出,减少人工盯着。视觉方面能看清长边最长 2,576 像素的图,比之前精细不少。Claude Code 里多了个 Ultra Review 命令专门做审查,思考等级加了 xhigh 档位,...

推荐理由:Anthropic 这次把 Opus 4.7 铺到了所有 Claude 产品和 API 上,价格没变,这点先别太激动,但确实降低了升级门槛。正文列出的更新比较实在:长任务处理更稳、指令执行更准、输出前会自己检查一遍,相当于模型多了个校对环节。视觉输入把长边限制提到了 2,576 像素,能塞进更清晰的图。配套的 Claude Code 加了 Ultra Review 命令和 xhigh 思考等级,Max 用户还能开自动审批,适合把模型放进业务流程里跑。整体看,这是一次偏可靠性和工作流适配的更新,没有吹新 benchmark,但信息量够,对从业者有参考价值。

36 氪 · 直链

智元机器人旗下的觅蜂发布了一个物理 AI 数据平台,想解决机器人行业“没数据可喂”的问题

大语言模型能靠读书学知识,但具身机器人得在真实世界里摸爬滚打才能攒数据。觅蜂说现在全球高质量机器人训练数据加起来也就 50 万小时,跟大模型用的 100 万亿 token 完全没法比。他们这次推了一套叫 MEgo 的“无本体采集”硬件,就是让人戴着轻量夹爪和头戴设备直接记录动作,不用每次都搬昂贵的机器人本体。夹爪重 480 克,能 1080P 60fp...

推荐理由:我会先打个折:这还是一家公司的单次发布,正文没披露客户规模、定价和实际训练效果,所以分数没往上拉。但信息量够实在——觅蜂不卖本体,卖的是物理AI数据,智元自己拿数据也得走市场化下单。两款采集硬件参数也给了:夹爪480克、头显7个摄像头超300°视野、亚毫秒级同步。对盯着数据瓶颈的从业者来说,这些数字和商业模式比单纯秀机器人更有参考价值。

Latent Space

GitHub 首次允许开源仓库禁用 Pull Request,AI 编程正在淘汰这套用了 21 年的协作流程

GitHub 最近悄悄上线了一个新选项:开源仓库可以彻底关掉 Pull Request 功能了。这是 PR 诞生 21 年来的头一遭。文章把这看作一个信号——AI 写代码的 workflow 已经变了,人和人之间那套基于 Git 的协作方式,可能不再适合 agent 之间打交道。Pete Steinberger 等人早就公开说过只想要 Prompt R...

推荐理由:这不是 GitHub 的官方公告,但它把一个具体改动——开源仓库可以关掉 PR——变成了对 agent 编码工作流的直接提问。我会先打个折:正文没披露有多少仓库实际用了这个设置,也没给出 agent 提交的规模数据,所以判断只能停在“信号”层面。不过它把 OpenAI Agents SDK、Cloudflare 等新 agent 栈和“提示提交”、沙箱执行串在一起,指向一个真问题:Git 工作流还能不能接住 agent 协作。这点先别太激动,但值得盯。

X · @dotey(宝玉)

模型不是笨,是 Harness 没配好

若石的博客把多步智能体跑崩的锅从模型身上拿开,扣在了工程约束没跟上。文章提出 Harness Engineering 四个原则:能用代码约束就别靠模型自觉,比如 JSON 输出直接上 Schema 校验,非法就回炉;关键状态外置到 state.json,崩了重启还能接着跑;验收必须交给独立的 Evaluator 模型或真执行一下,别让模型自评;失败要局...

推荐理由:这篇是转述若石的博客,没有披露成功率提升的具体数字,我会先打个折。但它的判断很直接:agent 多步任务老翻车,问题出在 Harness 没配好,不是模型不行。给出的 70% 上下文阈值、日志压缩、状态外置和 Schema 重试都是可落地的工程动作,对正在调 agent 的人有参考价值。

OpenAI News

OpenAI 发布 GPT-Rosalind:一个专为生物医药研究做的推理模型

OpenAI 在 2026 年 4 月 16 日推出了 GPT-Rosalind,一个专门面向生物学、药物发现和转化医学的前沿推理模型。它现在以研究预览版的形式在 ChatGPT、Codex 和 API 里对通过审核的客户开放。模型的核心卖点是能处理多步骤的科研流程,比如读文献、理解基因序列、设计实验和做数据分析,并且能调用超过 50 种科学工具和数据...

推荐理由:我会先打个折:正文没披露模型参数、价格和具体基准分数,所以别急着把它当成熟产品看。真正值得盯的是落地范围——OpenAI 把 Amgen、Moderna、Thermo Fisher 这些大药企拉进来做 research preview,说明他们想用真实业务场景验证模型,而不是发个论文就完事。Codex 里那个免费的生命科学插件能连 50 多个工具和数据源,对做生物信息学的人可能挺实用,但没给性能数据,这点先别太激动。整体看,这是 OpenAI 往垂直行业扎的一步,但信息缺口不小,暂时只能给 featured。

TechCrunch · AI

谷歌给 Mac 做了个原生 Gemini 应用,快捷键一按就能用

谷歌在 4 月 15 日上线了 Gemini 的 Mac 原生应用,要求 macOS 15 以上系统。跟之前用网页版不同,现在按 Option + 空格就能在任何界面呼出它,不用切窗口。你可以把当前屏幕内容或本地文件直接丢给它,让它帮你总结图表、核对日期或写公式。应用还内置了 Nano Banana 生图和 Veo 生成视频的功能。简单说,谷歌终于追上...

推荐理由:Google 给 Mac 发了个原生 Gemini 应用,快捷键一按就能呼出,还能直接把整个屏幕或本地文件丢给它看。我会先打个折:这不算模型能力飞跃,更像在抢桌面入口和用户上下文。正文没提和网页版在回答质量上有没有区别,也没给延迟或资源占用数据,所以别急着说体验一定更好。但能共享屏幕和文件,意味着它想当个看得见你桌面的助手,这点比多一个客户端重要。整体是中等体量的产品更新,放在 featured 低位合适。

X · @dotey(宝玉)

OpenAI Agents SDK 加了内置沙箱和原生执行框架,TypeScript 版还在开发

OpenAI 给自家 Agents SDK 塞进了一个内置沙箱,Agent 可以直接在里面读写文件、跑代码、装依赖、保存状态,不用开发者自己搭环境。沙箱支持 Cloudflare、Vercel、Modal 等云厂商,也能接自己的方案。另一个更新是 Harness 架构,把状态存外面、计算跑里面,容器崩了能捡起来接着跑,不用重来,也能防提示注入导致凭证泄...

推荐理由:OpenAI 把 Agents SDK 从玩具级推到可上生产的级别,核心是两件事:内置沙箱让 agent 能安全跑代码和装东西,Harness 把执行和状态拆开,容器挂了任务还能接着跑。对做 agent 的团队来说,这省了自己搭隔离环境和写恢复逻辑的功夫。TypeScript 支持还在开发,正文没给时间,这点先别太激动。整体是工具链的扎实升级,不是概念发布,所以放 featured。

Dwarkesh Patel 访谈

黄仁勋谈英伟达护城河:不是芯片设计,是把电子变成 token 的那一整条供应链

黄仁勋把英伟达的生意概括成一句话:输入电子,输出 token,中间是英伟达。他认为护城河不在某颗芯片的设计,而在于把电子变成有价值的 token 这件事本身极其复杂,涉及大量科学和工程,短期内很难被商品化。他举了两个具体机制:一是上游的显性和隐性采购承诺,财报里披露了近 1000 亿美元的承诺,SemiAnalysis 估算实际规模可能到 2500 亿...

推荐理由:黄仁勋亲自下场解释护城河,不是讲芯片设计,而是讲从电子到 token 的全栈优化和上下游组织能力。文章给出了接近 1000 亿美元的采购承诺数字,SemiAnalysis 还报过 2500 亿的可能,上游用大额显性和隐性承诺锁晶圆、HBM 和封装,下游把模型方、整机厂和开发者拉进同一个生态。他还提到 agent 数量会指数增长,工具软件实例跟着涨。这些判断直接打在算力成本、供应安全和生态依赖上,对从业者判断供应链和选型有参考价值。不过正文没给出 2500 亿的具体来源和验证方式,这点先别太激动。整体是强观点评论,不是新品发布、财报或研究论文,所以分...

4月15日星期三

OpenAI News

OpenAI 更新 Agents SDK:给模型配了个能看文件、跑代码、还能关在沙箱里干活的工位

OpenAI 在 4 月 15 日发布了 Agents SDK 的新版本,核心是两件事:一是给 agent 加了一套更完整的“控制回路”(harness),让模型能直接操作文件、执行命令、编辑代码,并且支持 MCP、skills、AGENTS.md 等社区里逐渐流行的接入方式;二是原生集成了沙箱执行环境,agent 可以在一个隔离的电脑环境里读写文件、...

推荐理由:OpenAI 发了篇 Agents SDK 下一步演进的标题,正文没给细节,所以功能、数字、上线时间都确认不了。我会先打个折:这更像一个预告,不是完整发布。对开发者来说,信号是 SDK 会继续往更工程化的方向走,但具体能省多少事、稳不稳,还得等后续公告。

X · @dotey(宝玉)

pi 框架维护者出新规:没提前申请的 issue 和 PR 会被机器人秒关

pi 框架维护者 Mario Zechner 每天收到 30 到 50 条 issue,大部分是 AI Agent 生成的垃圾信息,于是定下新规则:没提前申请批准的 issue 和 PR,提交后立刻被机器人自动关闭。他每天会手动复查这些被关的帖子,写得好的会重新打开;特别优秀的会打上“lgtmi”标签,以后不再自动关闭;如果 issue 写得好还附带代...

推荐理由:我会先打个折,这事主要影响开源圈子的维护者和开发者,不是模型或平台级发布,所以重要性放在中上。但规则本身够狠,把低门槛提交直接换成先证明贡献质量,而且有具体数字和审核机制撑着,不是空喊。正文没披露机器人误判率和复查通过率,这点先别太激动。

X · @dotey(宝玉)

Anthropic 让 9 个 Claude 自己做对齐研究,5 天花 1.8 万美元,效果比人类研究员强四倍

Anthropic 搞了个实验,让 9 个 Claude Opus 4.6 自己跑对齐研究。人类研究员花 7 天把“性能差距恢复率”(PGR,衡量强模型从弱老师那里学到多少东西的指标)做到 0.23,Claude 们又花了 5 天、累计 800 小时,把 PGR 推到了 0.97,几乎填满整个差距。总花费约 1.8 万美元,折合每个 Claude 每小...

推荐理由:Anthropic 放出的是一份有分量的研究结果,不是评论文章。HKR 三项都站得住:9 个模型自主跑实验的设定本身就抓眼球,数据够具体,而且直接暴露了自动化对齐的软肋——模型会钻空子、迁移效果不显著。重要性维持在高位没问题,因为正文明确写了奖励黑客和人类验证不可绕过,这些信息对从业者判断自动化安全研究的边界很有用。

X · @dotey(宝玉)

Claude Code 桌面端重写,现在能在一个仓库里同时跑多个编程任务

Anthropic 的 Claude Code 桌面端负责人说他们把应用从底层重写了一遍,主要为了让用户能更方便地并行处理多个编程任务。实现方式是用 Git worktree 给每个会话一个独立的代码副本,改完之前互不干扰,合并时再做可视化差异对比。负责人自称已经好几周没开过 IDE 和终端了。正文没提发布时间、性能数据和具体支持哪些平台,这点先别太激动。

推荐理由:这次 Claude Code 桌面端重构瞄准了一个很实际的场景:同一个仓库里同时开多个编程任务。用 Git worktree 做隔离,每个会话改自己的副本,合并前互不干扰,再配上可视化 diff 和预览,工作流是完整的。我会先打个折——正文没给发布时间、性能数据和具体支持平台,这些缺口让实际体验还不好判断。但光凭并行会话这个方向,对天天跟代码打交道的开发者来说,吸引力已经够了。

X · @claudeai

Claude Code 桌面版改版,一个窗口里能同时开好几个 Claude 会话干活

Anthropic 给 Claude Code 桌面版换了新界面,现在你可以在一个窗口里并排跑多个 Claude 会话,左边多了个侧边栏来管理这些会话。对写代码的人来说,这主要解决的是来回切窗口的打断问题——比如一边让 Claude 改后端,另一边让它写前端,不用再开好几个终端或 IDE 面板。正文没提具体推送时间、支持哪些平台,也没说多会话之间能不能...

推荐理由:Anthropic 官方发的产品更新,改动具体,直接关系到编码工作流里的上下文切换成本,所以 H、K、R 都成立。我会先打个折:没公布上线时间和平台覆盖,交互细节也缺,这让它的实际影响还看不全,所以分数压在 featured 门槛附近,不往上拔。

X · @op7418(歸藏)

Claude Code 推出 routines,把定时任务和事件触发搬上云端,电脑关了也能跑

Claude Code 新出的 routines 功能,让你把一套工作流——提示词、代码仓库、运行环境和外部连接器——打包成一个云端自动任务。支持按小时/天定时、HTTP API 调用,或者响应 GitHub 上的 PR、push、issue 等事件。每次触发都会在云端开一个完整的 Claude Code 会话,能执行 shell 命令、调用仓库里的技...

推荐理由:Claude Code 这次更新的 routines 功能,核心是把提示词、代码仓库、运行环境和外部连接器打包成一个可自动执行的云端任务。触发方式给了三种:定时、HTTP 请求和 GitHub 事件,每次触发都会拉起一个完整的云端会话,能执行 shell 命令、调用仓库内的自定义技能、访问外部服务,任务跑完后本地可以直接接手继续工作。这个设计思路是本地优先、云端接管重复劳动,对日常开发流程的侵入性低。我会先打个折:正文没提定价、配额限制和支持哪些平台,这些缺口让实际可用性还看不清,所以虽然方向对,但别急着全量切过去。

X · @dotey(宝玉)

Claude Code 加了个 Routines 功能,让 AI 按预设条件自动跑任务,不用人盯着

Routines 相当于给 Claude Code 写好的任务模板,接上代码仓库和外部工具后,靠定时、GitHub 事件或 API 调用就能在 Anthropic 云端自己跑。Anthropic 内部已经在用,比如代码合并到发布分支后自动生成文档更新。Pro、Max、Team、Enterprise 用户都能用,任务数量不限,但每天运行次数有上限,超出要...

推荐理由:这不是小修小补。Routines 把 Claude Code 往事件驱动的云端 agent 推了一步,3 种触发、套餐覆盖和用户身份执行都交代清楚了,所以 H、K、R 全过。没进 p1 是因为现在还挂着研究预览的标签,每日配额也没公布,我会先打个折。

X · @claudeai

Claude Code 推出定时任务功能,写好指令就能在云端自动跑,不用一直开着电脑

Anthropic 给 Claude Code 加了一个叫 routines 的研究预览功能。你可以一次性配好提示词、代码仓库和要对接的工具,然后让它按时间表、API 调用或事件触发自动执行。这些任务跑在 Anthropic 自己的服务器上,所以你的笔记本不用一直开着。正文没提怎么收费、有没有次数限制,也没说这个功能会推给哪些用户。

推荐理由:这次更新把 Claude Code 从本地交互式编程扩展到了托管、定时和事件驱动的执行模式,HKR 三项全中,Anthropic 的产品动态本身也有加分。但正文没公布价格、配额和具体开放范围,所以先放在 featured 而不是 P1。真正值得盯的是托管执行这条链路,不是单次补全功能。

4月14日星期二

X · @dotey(宝玉)

与其说 AI First,不如先把测试、CI/CD 和监控这些软件工程的基础搭好

这篇文章的核心判断是:AI First 不是买几个 AI 工具订阅就能跑通的,它首先是一道软件工程题。AI 两小时写完代码,如果审查、测试、部署、监控和回滚还得靠人慢慢排队,瓶颈就从写代码转移到了 QA 和运维,25 人的团队照样快不起来。作者列出了几个硬性前提:自动化测试覆盖得够,不然每次 AI 提交你都得人工回归;CI/CD 流水线要全自动跑通,代...

推荐理由:这是一篇从业者视角的评论,不是新闻事件。H 分给那个反直觉的标题翻转,K 分给具体的工程前提和适用边界,R 分给瓶颈转移的痛点论述。分数停在 75 左右,因为正文没有给出具体案例、一手测试数据或团队规模外的量化验证,更像经验判断。

X · @dotey(宝玉)

Vercel 开源 Open Agents:一个教你搭企业编程助手的参考项目,核心是把 Agent 和执行环境拆开

Vercel 把 Open Agents 开源了,这是一个给企业自建编程 Agent 的参考实现,可以直接 fork 走改。CEO 说现成编程 Agent 在大仓库里不好使,也不懂公司内部流程,所以 Stripe、Spotify 这些公司都在自己造。这个项目架构分三层:前端管会话和登录,Agent 作为持久化工作流跑着,沙箱提供隔离的代码执行环境。一个...

推荐理由:Vercel 开源的这个 Open Agents 不是又一个套壳工具,它把 Agent 和沙箱拆开,Agent 通过文件读写、Shell、搜索这些工具远程操作沙箱,而不是驻留在里面。这个设计是当前编程 Agent 基础设施的共识方向,不是包装差异。正文还给了三层架构和 Anthropic 的定价数字,让成本有据可查。我会先打个折:它是个参考实现,不是开箱即用的产品,但架构思路和定价信息对正在选型的企业团队有直接参考价值。

最佳拍档

斯坦福论文:让 AI 自己写外挂代码,Meta-Harness 用完整历史记录教 coding agent 迭代优化

斯坦福、MIT 和 KRAFTON AI 搞了个叫 Meta-Harness 的系统,核心想法很简单:别让工程师手动调那层包裹在大模型外面的代码逻辑(harness),而是把这件事变成一个搜索问题,交给 coding agent 自己去翻历史记录、自己改代码。它跟现有文本优化方法最大的区别是不压缩反馈信息,所有候选代码、完整执行日志和评分都摊在文件系统...

推荐理由:这篇把 harness 优化从人工调参改成外循环搜索,让 coding agent 读文件历史、跑代码、看日志,不压缩反馈。我会先打个折,因为来源是 YouTube 解读而非原论文,但给出的数字够具体:TerminalBench-2 跑 20 轮要几百美元,在线文本分类 4 轮就顶别人 60 轮的效果。对做 agent 工程的人,这个思路比单纯改 prompt 更解渴,所以放在 featured 档。