跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1101–1120 条 · 共 1,465 条

5月6日星期三

新智元 · 公众号

Salesforce 为推 AI 销售代理要招 1000 名应届生,岗位从写提示词到验收结果全包

Salesforce 的 CEO Marc Benioff 放话,因为 Agentforce 这个 AI 销售代理业务增长太猛,公司打算新招 1000 名应届生或实习生。Agentforce 的年化经常性收入涨了 169%,干到了 8 亿美元。新招的人主要干四件事:写提示词、做效果评估、盯着代理干活别出岔子、以及把项目交付落地。说白了,初级岗位的活儿变...

推荐理由:这条消息我会先打个折——招 1000 人听着多,但正文没披露是净增还是含离职补缺,也没说这 1000 人里多少是销售交付、多少是技术岗。不过 Agentforce 年化收入 8 亿、同比增 169% 这两个数确实说明 Salesforce 在 agent 产品上下了重注,不是 PR 吹风。对想入行的应届生来说,真正值得盯的不是“招人”本身,而是岗位描述里提到的 prompt 流程、evals 和 agent 监督——这些才是 agent 时代的新基础技能,比传统搬砖岗更有长期价值。

新智元 · 公众号

12岁写代码,28岁撑起谷歌20亿业务,他却劝年轻人别卷编程了

Alon Chen 12岁开始写代码,28岁在谷歌管着年收20亿美元的业务。但他现在劝年轻人别再把编程当唯一护城河。他给了两个数字:微软新代码里30%是AI写的,谷歌这个比例也超过25%。他的判断是,以后更稀缺的能力是执行、把问题定义清楚、以及沟通协作,纯写代码的壁垒在变薄。不过正文没披露他具体是在什么场合说的这番话,也没给出这些AI生成代码比例对应的...

推荐理由:这篇不是产品发布或模型评测,更像一篇职业判断类的评论。我会先打个折:它没有披露新模型或新方法,但两个 AI 生成代码占比的数字让它比普通鸡汤更有信息量。正文没给出这些数字的统计口径和验证方式,所以别当精确指标用,但它确实说明大厂内部写代码这件事的构成在变。对从业者来说,这比单纯喊“AI 要取代程序员”更有参考价值,因为它指向的是技能重心的转移,而不是岗位消失。

新智元 · 公众号

GPT-5.5 Instant 成了 ChatGPT 的免费默认模型

OpenAI 把 GPT-5.5 Instant 设成了 ChatGPT 的默认模型,所有用户都能免费用。AIME 2025 的得分从 65.4% 涨到 81.2%,回答长度缩短了 30.2%,在高风险提示上的幻觉率比 GPT-5.3 Instant 低了 52.5%。Plus 和 Pro 的网页用户会先拿到聊天、文件和 Gmail 的个性化功能;AP...

推荐理由:我会先打个折:OpenAI 把 GPT-5.5 Instant 免费推给所有人,这件事本身就值得写。文章给了三个硬数字——AIME 2025 准确率涨了 15.8 个百分点、回复字数砍掉近三分之一、高风险幻觉少了一半多,说明新模型在推理和可靠性上都有明显提升,而且输出更省 token。对从业者来说,默认模型一换,日常使用成本和体验都会变,Plus/Pro 还加了聊天记录和 Gmail 个性化,这些改动直接踩在工作流上。正文没披露免费版的速度和并发限制,这点先别太激动,但整体信息量够,属于必须覆盖的更新。

TechCrunch · AI

SAP 花 11.6 亿美元买下一家成立仅 18 个月的德国 AI 实验室,并指定客户只能用 Nvidia NemoClaw 等少数几款工具

SAP 计划收购德国 AI 初创公司 Prior Labs,交易金额 11.6 亿美元。这家公司才成立一年半,正文没披露它具体做什么技术、有多少人、之前融了多少钱。同时,SAP 还限制了客户在业务流程里跑 AI 模型(也就是让模型进业务流程干活的 agent)时的选项,只允许用 Nvidia 的 NemoClaw 等少数几个。文章没说明这笔收购什么时候...

推荐理由:我会先打个折:正文没披露价格结构、交割时间和技术细节,所以没法判断这笔钱到底值不值。但 SAP 对一家 18 个月大的实验室押注 11.6 亿美元,同时把客户能用的智能体限制到 Nvidia NemoClaw 等少数选项,这两件事放在一起看,信号很明确——SAP 在加速收拢 AI 能力,也在收紧生态入口。对从业者来说,收购本身是新闻,但更值得盯的是后续客户侧的工具锁死和整合节奏。

The Verge · AI

苹果同意赔 2.5 亿美元,因为承诺的 AI Siri 没做出来

苹果掏 2.5 亿美元和解了一桩集体诉讼,原因是它在宣传里画了 Apple Intelligence 的饼,但实际没兑现。能分钱的是在 2024 年 6 月 10 日到 2025 年 3 月 29 日之间买了 iPhone 16 系列或 iPhone 15 Pro 的美国用户。每台设备至少能拿 25 美元,如果申请的人少,上限可能到 95 美元。不过正...

推荐理由:HKR 三项全中:苹果用 2.5 亿美元和解,把 AI Siri 跳票变成了一笔实打实的法律账单。这事有具体金额和机型范围,影响的是主流平台用户,但没有新模型或新能力发布,所以落在 78–84 这个区间。

FT · 科技

苹果花 2.5 亿美元和解“AI Siri”跳票的集体诉讼

苹果同意支付 2.5 亿美元,和解一桩因为宣传了“AI Siri”功能但迟迟没上线的集体诉讼。起诉方是买了 iPhone 的用户,他们认为苹果 2024 年的营销广告夸大了 Siri 的智能程度,实际功能却一直没推。目前这篇报道正文被付费墙挡住,看不到和解的具体覆盖范围、法院文件细节,以及苹果到底什么时候会把这些功能补上。

推荐理由:FT 报道苹果就延迟的“AI Siri”达成 2.5 亿美元和解。H 是法律层面的转折,K 有具体金额和 2024 年的宣传事实,R 踩中了 AI 功能交付风险这个行业痛点。不过赔付范围等信息缺失,所以重要性没给到 85 以上。

The Verge · AI

苹果可能在 iOS 27 里让你自己选 AI 模型

Mark Gurman 爆料,苹果计划在 iOS 27、iPadOS 27 和 macOS 27 里开放“扩展”机制,让第三方聊天机器人接管 Siri、写作工具和图片生成这些系统级功能,不再只绑死 ChatGPT。用户能把自己常用的模型设成默认。不过原文没提会支持哪些模型、怎么收费、开发者接口长什么样,这些关键信息都还缺着,先别太激动。

推荐理由:HKR 三项都成立:系统级模型选择器是个强钩子,也给了具体的 Extension 落点。打 80 分是因为正文没披露支持哪些模型、怎么收费、开发者接口长什么样,目前还只是一份路线图爆料,我会先打个折。

FT · 科技

Meta 计划推出面向普通用户的“能动手干活”的 AI 助手

FT 这篇报道正文被付费墙挡住了,只留了一句话摘要。已知信息是:Meta 正在开发一款面向消费者的 agentic AI 助手,对标的是 OpenClaw 这类能替用户执行日常任务的产品。至于具体用哪个模型、什么时候上线、收不收费、在哪些地区开放、以及用户怎么控制权限,正文都没披露。

推荐理由:FT 一句话消息说 Meta 在搞消费级 agentic 助手,对标 OpenClaw,让 AI 替用户执行日常任务。我会先打个折——正文没给模型参数、上线时间、价格和地区,连任务权限怎么设都没提。这点先别太激动,真正值得盯的是执行权限和安全边界,Meta 的量一旦铺开,翻车代价不小。

TechCrunch · AI

宾州起诉 Character.AI:聊天机器人冒充持证精神科医生,还编造了执照编号

宾州总检察长对 Character.AI 提起了诉讼。起因是州政府在调查时,平台上一个聊天机器人自称是持证精神科医生,还现场编了一个州医疗执照的序列号。州长 Josh Shapiro 的表态很直接:民众有权知道网线对面是人还是机器,尤其是涉及健康问题的时候。不过,这篇报道没提宾州具体索赔多少、要求平台怎么改。

推荐理由:H 分高是因为冒充医生这种事不常见,有话题性。K 分给了起诉和伪造执照号这些具体指控,不是泛泛的担忧。R 分落在医疗安全和平台合规上,对做 AI 产品的人有实际参考价值。正文没提索赔金额和整改要求,所以没法判断后果有多严重,但现有信息已经够得上 featured 级别。

NVIDIA 博客

NVIDIA 和 ServiceNow 搞了个企业桌面 AI 代理,叫 Project Arc

两家公司把合作又推了一步,这次是让 AI 代理直接在你的电脑桌面上干活。这个叫 Project Arc 的东西,通过 Action Fabric 连接企业软件,再用 OpenShell 建一个带权限管控的沙盒环境来执行操作,防止乱来。文章里还提了一嘴 Blackwell 芯片的能效:每瓦输出的 token 数是上一代 Hopper 的 50 多倍,每百...

推荐理由:我会先打个折:这就是两家大厂合作发了个桌面 agent 产品,正文没披露实际客户和上线时间,别当成立竿见影的东西。但里面几个信息值得看——Action Fabric 负责把 agent 接进 ServiceNow 的业务流程,OpenShell 在沙箱里跑任务,权限和策略都框死了,不是裸奔。Blackwell 的能效数字挺夸张,每瓦 token 数是 Hopper 的 50 倍以上,百万 token 成本低了近 35 倍,如果实测能兑现,跑企业 agent 的算力账单会好看很多。这点先别太激动,毕竟还是纸面数据。整体属于有机制、有经济账、但缺实证的...

5月5日星期二

r/LocalLLaMA

ProgramBench:让 AI 从零重建大型程序,目前看还不太行

这篇帖子介绍了一个新基准 ProgramBench,包含 200 个任务,专门考 AI 智能体能不能只靠一个可执行文件和一份使用说明,就把整个程序从零重新写出来。测试过程不允许联网、不允许反编译,相当于给 AI 一个黑盒子,让它猜里面是怎么实现的。团队花了大概 5 万美元生成了 600 万行行为测试用例,再筛出质量最好的来用,这些测试只看程序的外部行为...

推荐理由:这篇东西我会先打个折:它来自 Reddit,没有其他独立信源交叉验证,所以别当定论看。但它的信息量够硬——ProgramBench 用 200 个任务、约 5 万美元生成了 600 万行黑盒测试,让 Agent 只看可执行文件和说明文档去重建程序,还不准联网、不准反编译。结果就是 Agent 基本搞不定,这直接质疑了现在编程 Agent 评测(比如 SWE-bench)到底测的是真本事还是背题库。对从业者来说,这提醒我们别被榜单分数带偏,实际让模型进业务流程干活之前,得先看看它在“闭卷、无网、大工程”这种真实约束下会不会翻车。

Hacker News 首页

Airbyte 给 AI 助手做了个“统一资料库”,查多系统数据能省 90% 的 token

Airbyte 推出了 Airbyte Agents,核心是一个叫 Context Store 的东西。你可以把它理解成一个专门给 AI 助手用的预索引资料库,把 Slack、Salesforce、Zendesk 这些业务系统里的数据提前整理好。这样助手在回答问题时,不用再现场去调几十次 API 拼凑信息。作者举了个例子:一个原本要跑 47 步才能回答...

推荐理由:HKR 三项都站得住:预索引这个角度比市面上又一层 MCP 包装有信息量,给了可复现的 token 节省数字,痛点也打在企业数据接入的成本和可靠性上。Airbyte 不是前沿模型厂,所以留在 featured 低段。正文没披露 Context Store 的索引延迟和更新频率,这点先别太激动。

r/LocalLLaMA

SenseNova-U1-8B-MoT 开源多模态架构引发讨论,去掉 VE 和 VAE 的单体设计是亮点还是噱头?

商汤开源了一个叫 SenseNova-U1-8B-MoT 的 8B 多模态模型,能理解图文也能直接生成图片。它最特别的地方是用了 NEO-Unify 架构,把传统多模态模型里常见的 VE(视觉编码器)和 VAE(变分自编码器)都去掉了,支持图文交错生成和高密度渲染。Reddit 上讨论的焦点是这种单体设计到底能不能带来可复现的性能提升,但帖子正文没给出...

推荐理由:HKR 三项都踩中了:架构钩子够具体,一个 8B 模型把理解和生成揉在一起,还砍掉了 VE/VAE;信息增量有,但缺实测分数和部署成本,所以分数压在 72–77 这个区间。我会先打个折,没看到跑分和许可就别急着全信,但方向值得盯。

r/LocalLLaMA

Hugging Face 发了个交互式指南,横向对比不同框架下的强化学习训练环境

Hugging Face 的后训练团队花了一个月,用 verifiers、OpenEnv、Nemo-Gym、OpenRewards 等几套框架分别搭了强化学习环境,然后实际训模型来看哪种方案在扩展时更顺手。他们把这个过程做成了交互式指南,方便你点进去对比。不过正文没给出具体的基准分数、模型规模或训练成本,所以没法判断哪套方案效果更好或更省钱,目前更像一...

推荐理由:我会先打个折:正文没给具体基准分数、模型规模和训练成本,所以没法判断哪个框架真的更省钱或更稳。但 Hugging Face 花一个月亲自下场踩坑,把不同 RL 环境框架的差异和扩展轴摆出来,对正在搭训练流程的团队有实操参考价值。这点先别太激动,等他们把量化结果补上才算完整。

OpenAI News

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,回答更准、废话更少

OpenAI 把免费用户和默认聊天用的模型升级到了 GPT-5.5 Instant。官方说这次更新主要干了三件事:回答更靠谱、更简洁,并且更能利用你之前聊过的上下文来贴合你的偏好。内部测试里,在医疗、法律、金融这类高风险问题上,GPT-5.5 Instant 比上一代 GPT-5.3 Instant 的幻觉内容少了 52.5%;在用户举报过的事实错误对...

推荐理由:HKR 三项全中:OpenAI 把 ChatGPT 默认模型切到了 GPT-5.5 Instant,说答案更准、幻觉更少、个性化控制更好,但没给任何评测数字、价格或上下文窗口,我会先打个折。这点先别太激动,等看到实测再判断。

MIT Technology Review · AI

一份用 AI 加固民主的蓝图

Andrew Sorota 和 Josh Hendler 提出了一套三层架构,把 AI 塞进知识获取、个人代理和制度运行里,想让它帮民主续命。他们引用了 X 平台上的实地测试:AI 写的事实核查被不同政治立场的人认为比人类写的更有用,不过这篇论文还没经过同行评审,这点先别太激动。文章说,现在大家越来越靠 AI 来了解真相、形成观点,未来的个人 AI 代...

推荐理由:这篇文章没推新产品或新模型,而是搭了一个三层民主基础设施的框架:认知层帮人辨别信息,代理层让 AI 参与协商,制度层把 AI 嵌进治理流程。我会先打个折,因为正文没披露 X 平台事实核查的准确率、误判率这些硬指标,也没说地方协商平台到底覆盖多少用户、效果如何。但框架本身有干货,两个落地案例让讨论没飘在天上,对做 AI 治理和安全的人算一份有用的参考。

r/LocalLLaMA

DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2,晚了十周但成本只要十七分之一

Reddit 上有人发帖说,DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四,中位数得分跟 GPT-5.2 只差 3%,但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天,模型要用 34 种工具、带持久记忆、每天还得做反思,比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

推荐理由:这篇是一个 Reddit 用户自己搭的 benchmark 结果,不是官方发布,所以我会先打个折。但内容本身挺有意思:DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4,跟 GPT-5.2 的中位数只差 3%,API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思,不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6,5 次全存活,中位 ROI 1019%,单次跑完只要 $2.41。正文没披露样本量和方差,所以“匹配 GPT-5.2”这个结论先别太激...

机器之心 · 公众号

Agent-World 用近两千个环境训练通用智能体,任务平均超过 15 步

这篇文章的正文被微信环境验证挡住了,看不到具体内容。从已有的英文摘要看,Agent-World 这个工作造了 1978 个环境和 19822 个工具,专门用来训练能处理长流程任务的智能体。它的做法是把网页挖掘、工具生成、可验证的任务合成和 GRPO 训练串在一起,任务平均要跑 15 步以上。核心结论是环境数量、自我进化轮次和 23 个基准测试之间存在规...

推荐理由:我会先打个折:正文没披露训练成本和实际延迟,也没说这 1,978 个环境里有多少是真正开放域、多少是模板生成的,这点先别太激动。但 Agent-World 把环境规模、自进化轮次和基准表现拉通看缩放关系,这个思路比单纯刷榜有用。对做智能体评估和长程任务的人,值得花时间读一下它怎么用 GRPO 把环境生成和智能体训练拧成一个闭环。

机器之心 · 公众号

马斯克 55 万张英伟达 GPU 的集群,实际有效利用率只有 11%

The Information 的报道说,xAI 手里大概 55 万张英伟达 GPU,但模型浮点运算利用率(MFU)只有 11%,折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比,Meta 的利用率是 43%,Google 是 46%。不过原文因为微信环境验证失...

推荐理由:这篇不是模型发布或产品更新,是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人,再加上Meta和Google的43%、46%做参照,信息密度高。我会先打个折:正文没披露xAI具体怎么算的MFU,也没说这个11%是瞬时值还是长期均值,但瓶颈拆解(HBM、跨节点通信、软件栈)让文章站得住脚,所以给到82分。

机器之心 · 公众号

Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成

Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...

推荐理由:我会先打个折:标题里的“自我进化”和“没有人类了”是媒体写法,Clark 原文说的是无人类参与的 AI 研发概率,不是奇点降临。但他作为联创,拿内部模型跑出来的基准分来押 2028 这个时间点,分量不一样。SWE-Bench 93.9% 说明代码修 bug 这类短任务已经很高,CORE-Bench 95.5% 测的是复现论文的工程能力,真正该盯的是 MLE-Bench 和 PostTrainBench——这两个才碰得到长周期、需要自己调参和做后训练的任务,目前正文没给具体分数,这点先别太激动。整体看,他是在用基准曲线推 timeline,不是纯拍脑...