跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1201–1220 条 · 共 1,465 条

4月27日星期一

量子位 · 公众号

Meshy 用户破千万后开始做 3D 打印实物,ARR 一年翻了 14 倍

Meshy 的注册用户超过一千万,ARR(年经常性收入)做到 4000 万美元,2025 年收入同比翻了 14 倍。他们新推的 Meshy Creative Lab 能直接生成钥匙扣、冰箱贴、键帽这类小物件的 3D 模型,但正文没披露实物下单功能是否已上线。一个值得留意的数据是:他们测了 75 个模型,在拓竹切片软件里的切片通过率达到 97%,说明模型...

推荐理由:Meshy 这次更新不是画饼,是拿钱和打印通过率说话。我会先打个折:实物订购还没上线,正文只说“进入倒计时”,这点先别太激动。但 97% 的切片通过率对 3D 打印玩家是实打实的省事信号,说明模型不是只能看,真能打。ARR 年翻 14 倍也侧面印证头部厂商已经在买单,不是靠免费用户撑场面。整体是垂直 3D AI 产品的一次公司自曝数据更新,信息量够,但没到行业地震级别,放在 featured 低位合理。

Hacker News 首页

Chrome 内置 Prompt API:在浏览器里直接跑大模型

Chrome 给开发者提供了一个 Prompt API,让网页可以直接调用浏览器内置的 AI 模型来生成文本,不用把数据发到云端。这个 API 还支持会话管理(保持多轮对话上下文)和结构化输出(让模型按固定格式返回结果,方便程序解析)。文档里没写具体用的是什么模型、上下文窗口多大、收费不收费,也没提什么时候能正式上线。目前看起来还在早期试验阶段,适合想...

推荐理由:Chrome 把 AI 塞进浏览器里,网页调个 API 就能用,这个入口变化挺大。会话管理和结构化输出两份配套文档让方案看起来不是空壳,但正文没提模型规格、上下文窗口多大、要不要付费、什么时候正式上线,所以我会先打个折,放在 featured 里偏低的位置。

机器之心 · 公众号

ACL 2026 论文:给 AI 发个波浪号,它可能把你的主目录删了

这篇被 ACL 2026 接收的论文专门研究了表情符号对 AI 的语义干扰。团队拿 6 个模型测了 3757 条样本,平均混淆率 38.6%,而且超过九成出错时模型不会吭声,直接静默执行错误指令。最要命的是在 agent 干活的环境里,你让模型“忽略表情符号”的提示词效果很有限。正文没披露具体是哪些模型,也没说测试用的 agent 框架和任务场景,所以...

推荐理由:ACL 2026 这篇安全研究 HKR 三项全中:钩子用一个波浪号删主目录,够直接;3,757 用例、6 模型、38.6% 混淆率和 90%+ 静默失败,数据不虚;真正要命的是 Agent 场景,符号混进执行链后模型一声不吭就动手。不是模型发布或平台事故,纯研究,放在 78–84 分段合理。

OpenAI News

OpenAI 开源了一套叫 Symphony 的规范,把项目管理看板变成 AI 编程 agent 的指挥中心

OpenAI 放出了 Symphony,一个开源的 agent 编排规范。它的核心思路是把 Linear 这类任务看板当成控制面板,每个待办任务都会自动分配一个编程 agent 去干活,人只负责最后审查结果。OpenAI 内部团队用上后,合并的 PR 数量三周内涨了五倍。工程师不用再同时盯着好几个 agent 会话,避免了频繁切换上下文的痛苦。agen...

推荐理由:H 和 R 都站得住:OpenAI 开源一个 Codex 编排规范,对 agent 工作流有直接关联,issue 变常驻 agent 的设想也够具体。K 这边我会先打个折,因为许可、接口、可复现的机制全都没披露,现在只能当个方向性信号看,别太激动。

Hacker News 首页

停止招新人,你的资深工程师就会反过来拿捏你

Justin Smestad 算了一笔账:如果公司从 2026 年起不招初级工程师,到 2030 年就会养出一支全是贵价老兵的团队,而且毫无还价能力。逻辑很简单——一个资深工程师可以开口要 40% 的涨薪,如果公司没有培养了两年的后备梯队,替代他可能要花六个月,还得按更高的市场价招人。初级员工不只是干杂活,他们是未来的中坚力量,是薪资谈判时的保险。文章...

推荐理由:这篇不是讲模型或产品,是一篇个人评论,但把账算得很清楚。核心逻辑是:你现在省掉初级人头,两年后高级工程师开口要 40% 涨薪,你连个能顶上来的中级都没有,外面招人还得搭进去半年。我会先打个折,因为 40% 和 6 个月这些数字正文没给出处,更像经验估算。不过它提醒了一件容易被季度报表掩盖的事——用 AI 代理替掉初级岗,省的是工资,多出来的可能是组织断层和议价权转移。对在看人效和 AI 落地的团队,这个视角值得扫一眼。

4月26日星期日

Hacker News 首页

别把 AI 代理当同事,把它嵌进你的软件里

Feldera 的联合创始人 Gerd Zellweger 认为,现在流行的 AI 代理(比如那些帮你写代码、查问题的机器人)太像人了:爱解释、爱总结、需要来回对话,用起来很累。他提出应该把代理嵌入现有软件,让它安静地在后台干活。文章给了三种已知的集成模式:命令行接口(CLI)、声明式配置(告诉系统要什么结果,别管步骤)、以及像 Kubernetes ...

推荐理由:这篇文章是 Feldera 联合创始人的工程观点,不是产品发布或一手评测,但把 Agent 嵌入软件的三种模式讲得清楚。我会先打个折,因为正文没给出实际部署数据或对比实验,更像架构主张。不过它把“Agent 解释新信息,数据库引擎持续执行逻辑”这个分工点透了,对正在纠结 Agent 交互形态的从业者有参考价值,所以放在 featured 里。

TechCrunch · AI

Anthropic 搞了个内部跳蚤市场,让 AI 替员工砍价买卖

Anthropic 在公司内部做了个叫 Project Deal 的实验:69 名员工每人领 100 美元预算,让 AI 代理替他们在二手市场里买卖真实物品。最终成了 186 笔交易,总金额超过 4000 美元。实验同时跑了四个市场,分别用不同水平的模型。用更聪明模型代理的用户,成交结果确实更好,但用户自己没感觉出来——Anthropic 管这叫“代理...

推荐理由:HKR 三项都站得住:Anthropic 搞了个内部代理交易市场,有预算、有成交笔数、有成交额,还分了四个不同模型的市场来对比。分数维持 82 分,因为这只是内部测试,不是公开产品或模型发布,我会先打个折。实验发现高级模型带来更好结果但用户没察觉差距,这点先别太激动,正文没披露交易的具体品类和失败率,验证还弱。

4月25日星期六

Hacker News 首页

AI 代理的故事里缺了什么:不是模型能力,是信任边界

Mark Nottingham 直接戳破了“AI 代理为你工作”这个说法。他列了 8 个互联网信任崩塌的真实案例,其中一个是微软新版 Outlook 会偷偷把第三方邮箱密码传到自家云端,再分给 700 多个数据伙伴。核心问题不是模型不够聪明,而是我们根本没想清楚:当软件能替你做事时,它到底在替谁做事。文章没给技术方案,但把“委托边界”这个被忽略的前提摆...

推荐理由:HKR 三项都成立,但这是署名评论而非模型或产品发布。Mark Nottingham 在 Web 协议领域的权威加上 Hacker News 上的讨论热度,让它够得上 featured 门槛,但到不了 P1。

Hacker News 首页

Stash 开源了一个 AI 记忆层,让任何智能体都能记住你是谁、聊过什么、踩过哪些坑

Stash 是一个开源的持久化记忆层,用 PostgreSQL 加 pgvector 做存储,给 AI 智能体配了 28 个 MCP 工具和一套 6 步处理流水线。它跟外挂资料库(RAG)不一样:RAG 只会翻文档,Stash 会从对话里自动提炼事实、建知识图谱、跟踪目标和失败记录,还能发现前后矛盾的地方。记忆按层级命名空间分桶,用户、项目、智能体自省...

推荐理由:我会先打个折:这是个独立开发者的开源基础设施项目,不是大厂或平台级发布,所以分数停在 featured 低段。但 HKR 三项都站得住。钩子不是“像 ChatGPT 一样记住你”的标题党,而是把记忆层做成可移植的中间件,任何 agent 都能接。正文给了足够的技术细节,28 个工具、6 个阶段、pgvector 存储和命名空间隔离,架构看得见。对 agent 开发者来说,长期记忆、上下文成本和供应商锁定是实打实的痛点,这个项目直接回应了这些需求。

Computing Life · Share · 鸭哥调研

Anthropic 让自家客户端跑别家模型,反常让步背后在赌什么

Anthropic 在 Claude Cowork 里加了个开关,让你能换成 GPT-5.5、Gemini 3.1 Pro 或 DeepSeek V4 来跑任务。这件事没开发布会,但跟它一个月前切断第三方客户端蹭自家订阅的动作连起来看,方向很明确:Anthropic 认为客户端才是粘性,模型是过路货。更反常的是,走这条路 Anthropic 既收不到订...

推荐理由:我会先打个折:来源非官方,Cowork 用户基数也小,所以没给更高分。但这条消息的钩子很强——让自家产品跑别家模型,还明确不收过路费,数据也不经手,这比单纯发个新功能更值得盯。文章把 AWS、Google、微软在 agent 运行时上的布局串起来,点出了模型层和基础设施层的博弈,对从业者判断生态走向有帮助。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 做生意的三个实验:从一台冰箱到一个市场

Anthropic 的 Frontier Red Team 在一年里做了三个实验,把真钱和真决策权交给 Claude。第一站是台迷你冰箱,Claudius 经营一个月亏了几百美元,还幻想出不存在的人、把自己当真人。第二站升级了工具和模型,加了 CEO 智能体,开始赚钱,但同模型互相监督带着同样的盲区,CEO 阻止了一些坏决策又制造了新的。第三站 Pro...

推荐理由:这篇文章把 Anthropic 三个商业实验串成一条线,从冰箱到市场,Claude 的弱点和强项都摆在台面上。有交易笔数、价差、用户主观感受这些具体数据,不是空谈 agent 概念。我会先打个折:正文没披露实验是否可复现、样本量是否够大,但就现有信息看,它对正在考虑让模型进交易流程的团队有直接参考价值,所以放在 featured 档。

Hacker News 首页

数据库没为 AI 代理这波操作做过设计

Arpit Bhayani 指出,让 AI 代理直接操作数据库,会同时打破我们过去四十年默认的四条规矩:查询是写死的、写入是有人审核过的、连接是短暂的、出问题有人盯着。他给 PostgreSQL 开了几剂具体药方:给代理用的数据库角色加上 5 秒语句超时和 10 秒事务空闲超时;全面改用软删除,并记录是谁删的、为什么删;对关键数据只追加不修改,靠事件日...

推荐理由:我会先打个折,这篇文章不是模型发布或产品更新,属于工程评论,所以分数放在 72–77 这个区间合理。但它的切入角度很刁,把数据库的老规矩和智能体的新行为直接对撞,而且给了能落地的 Postgres 防护参数,对正在让智能体进业务流程的团队来说,这些坑和补丁比泛泛而谈的安全建议有用得多。正文没给出大规模压测数据,所以别指望它能证明这些配置在生产环境扛不扛得住,但作为一份“把 agent_worker 当不可信调用方”的实操清单,价值够了。

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

X · @dotey(宝玉)

Cursor 3 加了 /multitask,能让多个子智能体同时干活,不用排队等

Cursor 3 新出的 /multitask 命令,可以同时跑好几个异步子智能体,不用像以前那样一个任务做完才能开始下一个。已经在排队里的任务也能随时切成并行模式。帖子没提同时能跑几个、吃多少资源、一个崩了会不会带崩其他的。

推荐理由:这次更新解决的是 Cursor 里一个挺烦人的瓶颈——以前子任务只能串行,现在能并行跑了,排队中的任务也能随时切模式。我会先打个折:正文没披露并发上限、资源占用和失败回退机制,所以实际能并行多少个、会不会吃满内存、一个子任务崩了怎么收场,都还不知道。但光是把串行改并行这一点,对日常编码吞吐的提升就够实在,所以放在 featured 低位。

Hacker News 首页

我用 Claude Code 定时任务自动盯家庭财务,每天一封邮件汇报资产和异常

作者 Matt May 用自己写的 Driggsby MCP 服务器接上 Plaid 拉银行和投资账户数据,再配合 Claude Code 刚出的 routines 功能,搭了一套每天自动跑的财务看板。他之前用 Codex CLI 写脚本抓数据,经常因为网页渲染变化或二次验证挂掉,后来干脆花了两个月、写了约 7.5 万行 Rust 代码做成 Drigg...

推荐理由:这是一篇扎实的一手实践记录:用 Claude Code routines 接 Plaid 做财务监控,因为 Gmail 接口只能写草稿,作者自己加了个受限的 email_me() 工具来发纯文本邮件,还定了近 7 天信用卡异动和单日超 500 美元告警的规则。HKR 三项都站得住,但本质还是个人产品博客,不是实验室或平台级发布,所以放在 featured 档。

X · @AnthropicAI

Anthropic 让 Claude 在旧金山办公室搞了个内部跳蚤市场,替同事买卖和砍价

Anthropic 发了个新研究叫 Project Deal。他们在旧金山办公室搭了个内部交易市场,让 Claude 替同事买东西、卖东西、谈价格。正文没披露用了哪个模型版本、市场有多大、成交了多少单,也没说最后是赚了还是亏了。这点先别太激动,目前看更像一个内部行为实验,不是产品发布。

推荐理由:这条能上 featured,靠的是 H 和 R 两项:Anthropic 自带关注度,让模型替同事谈办公室交易又天然有讨论性。我会先打个折——正文没给实验规模、模型版本和结果指标,K 项偏弱,所以分数停在中间档。

4月24日星期五

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

TechCrunch · AI

Meta 签下数百万颗亚马逊自研 CPU,这次不是 GPU,是给 AI 智能体跑业务用的

Meta 和亚马逊达成了一笔大单,要采购数百万颗亚马逊自研的 Graviton CPU,专门用来跑 AI 智能体(agentic AI)的工作负载。注意,这里说的是 CPU,不是训练大模型常用的 GPU。这信号挺有意思:以前大家抢 GPU,现在连 CPU 都开始为 AI 智能体这种新任务大量铺货了。不过正文没披露具体是 Graviton 哪款芯片、单价...

推荐理由:这条消息我会先打个折,因为正文没披露具体型号和金额,没法算性价比。但“几百万颗 AI CPU”这个量级本身就在说一件事:agent 负载开始推高非 GPU 芯片的采购。Meta 这种体量的公司用 Amazon 的 CPU 跑 agent,至少说明他们在认真找 GPU 之外的推理方案,而且敢下大单。这点先别太激动,毕竟没看到实测数据,但如果后续有部署细节和性能对比,这条线值得一直盯着。

The Verge · AI

DeepSeek 放出 V4 模型预览,说能跟 Google、OpenAI、Anthropic 的闭源模型正面打

DeepSeek 在 4 月 24 号发布了开源 V4 模型的预览版,声称性能可以对标美国几家头部公司的闭源系统。这次重点提了编程能力提升,并且强调跟华为的硬件兼容——这基本就是在说,模型能跑在中国自己的芯片上。不过正文没披露参数量、具体跑分和正式发布时间。我会先打个折:编程强了多少、在什么任务上强,都没给数据,这点先别太激动。

推荐理由:DeepSeek 这次放出的 V4 预览版,我会先打个折——参数、基准分数、商用时间全都没披露,所以别急着激动。但信息量还是够的:代码能力提升直接指向让模型进业务流程干活的 agent 场景,而华为兼容性把模型进展和国产芯片栈绑得更紧,这两点比单纯刷榜更有看头。正文没给具体数字,所以重要性停在 83,等有实测数据再往上调。

机器之心 · 公众号

Anthropic 承认 Claude Code 变笨了,是这三个 Bug 搞的鬼

Anthropic 出来解释了,过去一个月大家觉得 Claude Code 质量下滑,不是模型本身变弱,也不是 API 出了问题,纯粹是工程层面的三个 Bug。第一个是 3 月 4 号把默认推理强度从“高”调成了“中”,相当于让模型干活时少动脑子;第二个是 3 月 26 号会话缓存出了错,可能让模型记错上下文;第三个是 4 月 16 号给提示词加了 2...

推荐理由:Anthropic 发了一篇很实在的事后说明,把 Claude Code 近一个月体验下滑归因到三个运行框架和提示词的 Bug,模型本身没退化。我会先打个折:这不是模型能力问题,而是产品配置翻车,但对天天用 Claude Code 写代码的人来说,推理强度被偷偷从 high 降到 medium、输出被限到 25/100 词,体感就是降智。文章把 3 月 4 日、3 月 26 日、4 月 16 日三个时间点的改动和回滚日期都标出来了,信息密度够,也直接点了 Sonnet 4.6、Opus 4.6、Opus 4.7 受影响,还提到 4 月 23 日重置...