跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1241–1260 条 · 共 1,465 条

4月23日星期四

新智元 · 公众号

浙大开源多智能体叙事系统 OpenStory:把孙悟空扔进大观园,几分钟后角色全跑光了

浙大放出了一个叫 OpenStory 的多智能体系统,专门用来跑开放剧情。他们搭了个 1:1 的《红楼梦》大观园沙盒,把孙悟空塞进去当变量。结果几分钟内,记忆模块就把“孙悟空滥杀无辜”这条信息广播了出去,恐惧直接压过了角色的日常行为逻辑。王熙凤被物理移除后,恐慌连锁反应让整个大观园变成了空城。这个实验暴露的是多智能体系统里记忆和共识链路有多脆。不过正文...

推荐理由:我会先打个折:正文没写用了什么模型、怎么评测、实验能不能复现,所以别急着把它当成熟系统看。但这个故事本身很直观——孙悟空 Agent 被放进《红楼梦》1:1 数字沙盒,系统用记忆模块向所有活跃角色广播“孙悟空滥杀无辜”,恐惧权重直接压过日常行为逻辑,王熙凤被物理移除后,其他 Agent 集体逃离,大观园变空城。真正值得盯的不是孙悟空有多强,而是记忆广播和共识链路太脆弱:一条消息就能让整个 Agent 社会崩掉,说明多 Agent 之间的信息传递和信任机制几乎没有韧性。对做 Agent 安全、多智能体协作的人来说,这是一个很具体的压力测试案例,暴露了...

彭博科技

阿里在通义千问 App 里接入了东航订票,用户能直接搜航班下单

阿里把中国东方航空的机票预订功能塞进了通义千问 App,用户不用跳转就能完成航班搜索和下单。这是通义千问的 agent 技术第一次开放给大型商业伙伴,意味着它从聊天助手往交易环节里走了一步。不过正文没披露具体上线地区、舱位覆盖、支付流程和双方怎么分账,所以实际体验和商业回报还得再等等看。

推荐理由:我会先打个折:正文没披露上线范围、支付流程和分成结构,所以别急着算账。但 Qwen 从纯聊天界面跨到交易闭环,是 agent 落地的硬信号。东航作为首个大型商业伙伴接入,说明阿里在推模型进业务流程干活,而不只是答问题。这点先别太激动,等看实际跑起来的订单量和客诉情况。

X · @dotey(宝玉)

微软把 Copilot 智能体模式设为 Word、Excel、PPT 默认体验,个人和家庭版也能用

微软把 Copilot 的智能体模式(Agent Mode)设成了 Word、Excel、PowerPoint 的默认打开方式,Microsoft 365 Copilot 和 Premium 订阅用户现在就能用,个人和家庭版也一样。Satya Nadella 亲自发推,拿 Excel 举例说,电子表格的价值在于信息的空间关系,给智能体这样一张画布,一条...

推荐理由:这条消息够硬:微软把 Copilot 的 Agent Mode 设成 Office 三件套的默认体验,不是小范围测试,而是所有订阅用户即刻生效,个人版和家庭版都包括。我会先打个折,这不是新模型发布,但产品更新力度很大。内测数据有零有整,Excel 参与度涨 67%、点赞率涨 65%,Word 参与度涨 52%,PowerPoint 新用户留存涨 36%,说明默认开启确实拉动了使用。更值得盯的是文档内多步执行成了默认交互,用户能预览、保留或回退改动,这点降低了试错成本。正文没披露具体技术实现细节,但分发范围和默认策略本身已经够有话题性。

Hugging Face 博客

在 Chrome 插件里跑本地 AI:一份给开发者的架构避坑指南

Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...

推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。

FT · 科技

特斯拉把资本支出计划提到 250 亿美元,马斯克在 AI 上继续加注

特斯拉把资本支出计划上调到 250 亿美元,马斯克要把更多钱砸向 AI 相关项目。从 RSS 片段看,这些项目包括自动驾驶出租车、卡车、机器人以及芯片工厂,增幅被形容为“非常显著”。不过正文被付费墙挡住,没披露这笔钱覆盖的时间范围、具体怎么分项,也没提模型细节。能确定的一个信号是:特斯拉在投的不只是训练模型,而是从芯片到终端产品的整套体系。

推荐理由:FT报了一个具体的资本支出跳升数字,直接关联自动驾驶出租车、卡车、机器人和芯片工厂。我会先打个折:时间范围和分项花销都没给,模型细节也缺,所以不是必写级别。但250亿这个数够大,而且投向的是车、机器人和芯片产能整条链,不是只训模型,战略意义摆在那。HKR三项都踩中了,只是信息缺口让它停在featured中段。

The Verge · AI

OpenAI 把能自己干活的定制机器人开放给团队用了

OpenAI 把 ChatGPT 里的“工作区代理”功能下放给了 Business、Enterprise、Edu 和 Teachers 套餐。团队现在可以搭一个定制机器人,让它自己在云端跑任务,比如上网搜产品反馈、整理成报告发到 Slack,或者在 Gmail 里草拟跟进销售的邮件。这跟以前一问一答的聊天不一样,机器人能直接进到业务流程里干活了。不过正...

推荐理由:OpenAI 把 ChatGPT 从聊天框推进到团队工作流代理,HKR 三项都踩中:钩子够强,文章补了计划覆盖和任务示例,也切中企业自动化需求。没给 P1 是因为价格、铺开细节和能力边界正文都没披露,我会先打个折。

X · @dotey(宝玉)

OpenAI 在 ChatGPT 里上线工作区智能体,能跨工具自动干活,目前只给付费企业用户试用

OpenAI 给付费企业版 ChatGPT 加了个叫“工作区智能体”的功能,你可以用自然语言描述一套工作流程,它就能在后台自动跑起来,比如筛选销售线索、汇总工单、定时出报告。它跟之前自定义 GPT 最大的区别是能直接连 Slack、Gmail、Salesforce 这些工具,不光读信息,还能动手更新工单、建文档、回消息。管理员可以设权限和审批节点,不是...

推荐理由:OpenAI 把 ChatGPT 从对话工具往企业工作流里推了一步,这次放出的工作区智能体可以跨多个常用办公软件自动执行任务,比如更新工单、回 Slack 消息。我会先打个折:目前还是研究预览,正文没写定价、调用次数上限和哪些地区能用,所以别急着算投入产出。但管理员侧的权限和审批设计是实打实的信号,说明 OpenAI 在认真考虑企业治理需求,这点值得盯后续落地细节。

Latent Space

Shopify 的 AI 用量在 2026 年爆发,CTO 聊了无限 Opus-4.6 预算和内部工具 Tangle、Tangent、SimGym

Shopify CTO Mikhail Parakhin 在这期播客里详细拆解了公司怎么把 AI 用进骨子里。他说 2025 年 12 月模型质量有个明显跃升,之后内部 AI 工具的使用量就炸了,而且命令行工具的增长比传统 IDE 插件还猛。现在写代码已经不是瓶颈,瓶颈变成了代码审查、CI/CD 流程和部署稳定性,所以他们自己搞了一套 AI 代码审查系...

推荐理由:这篇是 Shopify CTO 的深度访谈,信息密度高,没有公关腔。我会先打个折:正文没披露 2026 年使用激增的具体数据,所以不能当硬证据用。但真正值得盯的是他们内部把 AI 编程的瓶颈从生成代码推到了评审和部署环节,这个判断对从业者比一个孤立的增长数字更有用。三个内部项目名字和定位都给了,不是空泛的趋势发言。整体属于有料、有判断、缺一点量化验证的优质一手信源,放在 featured 没问题。

Hacker News 首页

OpenAI 在 ChatGPT 企业版里上线了能自己干活的“工作区智能体”,目前是研究预览版

OpenAI 给 ChatGPT Business、Enterprise、Edu 和 Teachers 套餐加了一个叫 Workspace agents 的功能。你可以把它理解成在聊天工具里建一个能自动跑流程的助手:建一次就能共享给全团队,可以定时执行重复任务(比如整理销售线索、生成报表),也能直接操作 Slack、Google Drive、微软系应用...

推荐理由:OpenAI 放出了一个实打实的企业代理预览,HKR 三项全中:钩子是跨应用工作流自动化,正文给了治理控制的具体名目,又切中了企业采纳的核心顾虑。没给 P1 是因为价格、模型规格、上线时间全都没说,实际效果也还没验证,所以先打个折。

Hacker News 首页

Flipbook:一个完全由图片模型实时生成的无限视觉浏览器

Flipbook 把整个网页变成一张张像素图片,你点击任何地方,它都会生成一张更深一层的新图片,没有 HTML、没有代码、没有文字图层。所有文字都是图片模型直接画出来的,所以偶尔会画歪或写错,这点随着模型变强会改善。内容来自智能体联网搜索和模型自己的知识,准确度大概跟用 ChatGPT、Gemini 这类对话产品查到的差不多。团队说他们做这个是因为现在...

推荐理由:我会先打个折:正文没披露延迟、成本、模型栈和实际用量,所以分数停在 76。但 Flipbook 这个实验值得盯,因为它把网站变成了一串实时生成的像素图,点击哪里就继续画哪里,连文字都是画出来的,不是叠上去的。信息来自 agentic 网页搜索加模型知识,交互机制比普通生成式 UI 激进得多。视频流功能目前还是高耗资源的实验开关,这点先别太激动。

X · @OpenAI

OpenAI 在 ChatGPT 里加了“工作区 agent”,一个能跨工具、跨团队跑长任务的共享助手

OpenAI 发了一条推,说 ChatGPT 现在有 workspace agents,可以当成团队共享的助手,处理复杂任务和跑长时间的工作流。正文没披露具体支持哪些工具、怎么收费、什么账号能用、权限怎么管、什么时候推。我会先打个折:共享 agent 的协作边界才是关键,比如它能看到什么数据、谁能改它的指令,这些都没说,光看标题别太激动。

推荐理由:OpenAI 自己发的产品预告,共享代理这个方向比普通助手更新鲜,H 和 R 都站得住。但正文只给了概念,没给任何落地细节,所以 K 分不高,整体放在 featured 而不是更高。我会先打个折,等工具权限和定价出来再重新判断。

Hacker News 首页

Zed 编辑器推出并行 Agent 功能,一个窗口里能同时跑多个 AI 助手

Zed 在 4 月 22 日更新了并行 Agent 功能,核心是在一个窗口里同时跑多个 AI 助手干活。新增的线程侧边栏可以给每个线程单独设置能访问哪些文件夹和代码仓库,还能随时停止、归档或新建线程。默认界面布局也改了,线程和 Agent 面板挪到了左边,项目文件树挪到右边,老用户需要手动切换才会生效。Zed 团队说这个设计是为了让开发者既能用 AI ...

推荐理由:Zed 官方产品更新,HKR 三项都踩实了:并行 agent 加线程级权限隔离。分数停在 76 是因为正文没给性能对比、价格影响、用户量或外部验证,目前还只是单个工具自己的迭代,我会先打个折。

Hacker News 首页

有创业公司开始炫耀 AI 账单比员工工资还高,把 token 花费当成增长指标

Swan AI 的 CEO 发帖说,他们 4 个人的团队一个月给 Claude 花了 11.3 万美元,他把这笔钱看作本该用来招人的预算,目标是不到 10 个人做到 1000 万美元年收入。Fundable AI 的联合创始人也在底下附和,说 AI 能顶一个 15 人的文档处理团队。文章点出一个风向:token 花费正在被当成一种新的虚荣指标,但花得多...

推荐理由:我会先打个折:这篇不是硬核技术进展,而是一篇评论性质的趋势观察。H 分给得高,是因为它把“AI 账单超过人力成本”这个反转直接摆到台面上,容易引发讨论。K 分靠的是 Swan AI 那个 11.3 万美元/月的 Claude 账单,数字够具体,能让人直观感受小团队在模型调用上的投入有多猛。R 分确实有,它踩中了“用 token 消耗替代人头”的焦虑,但正文自己也承认这更像一种增长指标而非已验证的 ROI,Fundable AI 说能替代 15 人团队的说法也没给出验证细节,所以不能当市场级事件来推。整体判断:值得从业者看一眼,但别急着把它当成行业拐点。

4月22日星期三

The Verge · AI

Meta 开始记录员工电脑操作,用来训练能替你干活的 AI 助手

Meta 在美国员工的工作电脑上装了一个叫 MCI 的工具,会记录鼠标移动、点击、键盘输入,还会偶尔截屏。这些数据不是用来考核绩效,而是喂给 AI 模型,教它们像人一样操作电脑,以后自动处理员工现在做的重复性工作。Meta 说不会拿来做绩效评估,但正文没提数据会保留多久、员工能不能选择不用,也没说会不会推广到美国以外的地区。

推荐理由:我会先打个折:这不是产品发布或模型开源,而是一条内部工具被路透社挖出来的报道,所以信息缺口很明显。正文只说了美国员工和工作应用,保留多久、能不能退出、范围会不会扩大都没提。但这件事的传播力很强——Meta 直接拿员工的操作痕迹去教 agent 怎么像人一样用电脑,而且明确说数据不用于绩效考核,反而让人更想知道采集边界到底在哪。如果是真的,这种数据比外包标注便宜得多,但隐私和劳资关系的雷也埋得深。

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

机器之心 · 公众号

荣耀在 MagicBook 上预装 YOYO 爪,管它叫全球首款“智能体笔记本”

荣耀把 YOYO 智能体直接做进了 MagicBook 系统里,出厂自带 5 个主智能体和 23 个子智能体。官方说这套方案比外接 OpenClaw 省一半的 token 消耗,还加了本地处理、二次确认和内核级加密。说白了就是把智能体打包成笔记本默认功能,不用自己折腾部署。但正文没提具体用了哪个模型、硬件配置、卖多少钱、什么时候开卖,这些关键信息都缺着...

推荐理由:荣耀把 YOYO Claw 直接预装进 MagicBook,等于把智能体做成出厂能力,这点比跑分更有意思。文章列了 5 个主智能体、23 个子智能体,覆盖教育到内容创作,还提到本地处理、二次确认和内核级加密,信息量够硬。词元消耗降 50% 这个数我会先打个折,因为没给对比基准和测试条件。真正让我把分停在 76 的原因是正文没披露模型、硬件配置、价格和上市时间——缺了这些,没法判断实际成本和落地节奏。

The Verge · AI

SpaceX 签了个“可能买也可能不买”的协议,标的 Cursor,开价 600 亿美元

SpaceX 跟 AI 编程工具 Cursor 达成了一个二选一的交易框架:要么花 600 亿美元把 Cursor 买下来,要么付 100 亿美元分手费走人。文章没披露具体的交易结构、时间表,也没说跟 SpaceX 传闻中的 IPO 怎么挂钩。RSS 摘要里提了一句,这笔交易可能帮马斯克旗下的 xAI 在编程工具上追赶 Anthropic,但正文里没展...

推荐理由:标题说可能收购,但真正有信息量的是那笔 100 亿美元退出费——它更像一个约束机制,而不是简单的“不买了就赔钱”。正文只披露了顶层的两个数字,交易怎么设计、什么时候推进、跟 xAI 追 Anthropic 之间到底什么关系,全都没说。所以我会先打个折:事实够硬,但缺口也大,放在 featured 合适,别拔到 P1。