跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 741–760 条 · 共 1,465 条

5月28日星期四

AI HOT 精选

Perplexity 的 Computer 功能现在能直接嵌进 Word、Excel、PPT 和 Outlook 的侧边栏用了

Perplexity 把它的 Computer 助手塞进了微软 Office 套件里。你在 Excel、Word、PowerPoint 和 Outlook 的侧边栏就能直接使唤它,让它帮你起草文档、处理数据模型、做演示文稿或者打理邮件。正文没披露具体是哪个版本的 Office 支持,也没提需不需要额外付费。

推荐理由:Perplexity Computer 进了 Excel、Word、PPT 和 Outlook,能在侧边栏帮你起草文档、搭模型、做演示、处理邮件。这事本身有信息量,也戳中了办公 agent 入口的竞争点。但正文没提定价、权限控制、企业部署方案和实际效果数据,所以我会先打个折,不往更高层级推。

TechCrunch · AI

iOS 27 的 Siri 要独立成 App 了,渲染图先流出来,苹果想正面刚 ChatGPT

TechCrunch 拿到了一组新渲染图,显示苹果打算在 iOS 27 里把 Siri 拆成一个独立 App,交互也重新设计了。正文只给了这个信息,没提发布时间、具体功能参数,也没说底层模型是自研还是接别人的。我会先打个折:渲染图不等于最终产品,但独立 App 这个方向说明苹果想把 Siri 从系统助手升级成能跟 ChatGPT 对标的对话入口。

推荐理由:这条消息的看点在于苹果终于不再只把 Siri 当系统功能,而是拆成独立 app 去跟 ChatGPT 抢用户。我会先打个折:正文只说了 iOS 27 会改版、Siri 重设计、有独立 app,但没给发布时间,也没讲能干什么、怎么收费、模型跑在本地还是云端。如果是真的,苹果靠装机量和系统整合确实能省一大笔推广费,但没参数就没法判断能力到底行不行。这点先别太激动,等更多细节出来再下结论。

量子位 · 公众号

用有限状态机给 GUI Agent 合成训练轨迹,每条成本压到 0.04 美元

这篇讲的是 AutoWebWorld 这个项目,它没有靠人工标注或大模型当裁判,而是用有限状态机(FSM)来定义网页的状态、前置条件和跳转规则,自动生成并验证 GUI Agent 的操作轨迹。最终合成了 29 个网页环境、875 个页面和 11663 条经过验证的轨迹,平均每条轨迹的成本大约 0.04 美元。正文没披露具体用了哪些模型做测试,也没给出任...

推荐理由:我会先打个折:这不是顶级大厂的发布,所以分数压在 78–84 的研究工具档位。但 H、K、R 三条都站得住。0.04 美元一条轨迹是个能让人点进去的数字;放出的环境和轨迹量不算小,而且 FSM 内置状态验证这个设计,比靠人标或 LLM 打分更可复现,对做 GUI 智能体的人有直接参考价值。

量子位 · 公众号

DeepSeek V4 用上华为昇腾芯片做训练,国产算力生态开始跑通闭环

这篇文章本身因为微信环境验证失败,正文内容没抓到,只能根据标题和摘要信息来聊。标题里提到的“芯模协同”,指的是 DeepSeek V4 在训练时直接跟华为昇腾芯片做适配优化,不是先拿英伟达跑完再移植。摘要里说 CANN(华为的 AI 计算框架)一口气开源了 65 个代码仓库,并且支持 70 多个主流模型“开箱即用”,不用等适配。另外 AIGCode 在...

推荐理由:这条主要讲的是国产算力生态的进展,不是 DeepSeek V4 本身发了什么新能力。但里面给的仓库数、适配模型数、MFU 这些数字比较具体,比一般的合作通稿有信息量。我会先打个折,因为正文没披露 V4 在昇腾上的完整训练规模或成本对比,MFU 也只给了 AIGCode 一个点,验证还不够全。不过对关心国产替代进度的人来说,这几个数字已经够拿来判断方向了,所以放在 featured 里。

NVIDIA 博客

NVIDIA 在 ICRA 发了 8 篇论文,核心是让机器人在仿真里练完直接去现实世界干活

NVIDIA Research 在 ICRA 上展示了 8 篇论文,都围绕一个思路:在仿真里训练机器人,然后直接部署到真实环境。ScheduleStream 让多机械臂并行规划,速度提升 3 倍,代码已开源。COMPASS 导航框架完全不靠真实数据,在仿真里训练后迁移到真机,20 次真实导航测试成功率约 80%,比纯模仿学习基线高了 4.5 倍。Gra...

推荐理由:我会先打个折:这些成功率都是在论文设定的场景里跑出来的,换到更乱的现场不一定能复现。但 8 篇论文同时给出实机数据,而且不是零星的几次测试,ScheduleStream 的 3 倍提速和 COMPASS 的 20 次导航约 80% 成功,至少说明 sim-to-real 的 gap 在可控缩小。对正在纠结仿真训练能不能落地的团队,这组结果比纯讲架构有说服力。

Mistral AI

Mistral 将 Le Chat 升级为统一智能体 Vibe,覆盖办公与编码

Mistral 把 Le Chat 升级为统一 AI 智能体 Vibe,一个许可同时覆盖办公与编码,原有对话、设置和套餐全部保留。Work Mode 支持企业知识搜索、结构化数据分析、文档报告生成、多步任务定时调度和可复用技能,可连接 Google Workspace、Outlook、SharePoint、Slack、GitHub 等。

推荐理由:原文完整披露了 Vibe 的工作模式、编码模式与 CLI 更新,可据此判断它如何接入现有工作流。

阿里技术 · 公众号

用两个 Git 仓库把周报、洞察和效能报表自动化,省掉 80% 的手工活

周志伟分享了一套项目管理方案:用两个 Git 仓库,配合 AI 编程助手、Shell 和 Python,把催周报、搬数据、画图表、出工程效能报告这些事自动化了。正文没披露具体实现细节和验证数据,但按他的说法,至少能省掉 80% 的手工跟进和报表工作。

推荐理由:我会先打个折:80% 这个数字正文没给验证方法,别当基准看。但思路本身很实在——用两个 Git 仓库当数据源,让 AI 编码助手加脚本去自动拉数据、出图表、拼周报,把项目经理从催收和搬运里解放出来。对 AI 从业者来说,这不是模型或平台发布,而是一个可抄作业的工作流改造,成本低、痛点准,所以给了 featured。

AI HOT 精选

Mistral 在 AI Now 峰会上公布工业 AI 路线图,Vibe 升级,并在巴黎郊区建推理数据中心

Mistral 在自家峰会上主要说了三件事。第一,他们和空客、宝马、ASML 合作搞工业 AI,让模型进到设计、制造这类业务流程里干活,但具体怎么落地、效果如何正文没细讲。第二,Vibe 这个能处理长周期任务的 AI 助手迎来升级,具体能力变化也没展开。第三,他们要在巴黎南边的 Les Ulis 建一个 10 兆瓦的推理数据中心,计划 2026 年第三...

推荐理由:我会先打个折:这次没发新模型能力,也没给定价细节,所以重要性卡在 featured 门槛上。但 Mistral 把数据中心规格(10 MW)和时间表(2026 Q3)都摊出来了,还绑定了空客、宝马、ASML 这些实打实的工业客户,比纯概念发布实在。正文没披露推理成本的具体数字,这点先别太激动。整体看,对做工业 AI 和关注欧洲算力布局的人值得扫一眼。

Latent Space

Cognition 拿了 10 亿美元,估值冲到 260 亿,预计年底年经常性收入超 10 亿

Cognition 完成了 10 亿美元的 D 轮融资,估值 260 亿美元,比 8 个月前 C 轮时的 100 亿估值涨了 1.5 倍。公司自己预计到年底年经常性收入能超过 10 亿美元,客户里包括 Exa 和 Modal 这类挑剔的企业。正文没披露具体的利润率或成本结构,所以这个收入数字先别直接等同于利润。 这期 AI 新闻还提了几个技术趋势:推...

推荐理由:Cognition 这轮融资信息量很足。我会先打个折:260 亿估值和 10 亿年收入预期都是公司自己说的,正文没披露第三方验证,但即便打个七折也够猛。8 个月估值涨 2.5 倍,说明市场对 AI 编程 agent 这条路的买单意愿很强。对从业者来说,这不是又一家模型公司融到钱,而是一个把模型塞进开发流程干活的产品拿到了大额支票,信号比纯模型融资更实际。

新智元 · 公众号

清华团队开源 PilotDeck:让多个 AI 分工干活,Token 成本砍掉七成

清华 NLP 实验室、面壁智能、OpenBMB 和 AI9stars 一起放出了 PilotDeck 的开源代码。这套系统让多个 AI 子代理分工协作,各自有独立的工作区和可编辑的记忆库,每次任务还会留下调度日志。文章里举了个例子:在小红书内容生成测试里,用 PilotDeck 把成本从 12.58 美元压到了 2.83 美元,相当于省了 77% 的 ...

推荐理由:我会先打个折,标题里“彻底凉了”是流量话术,但正文确实给了硬数据:子 Agent 路由在小红书内容生成场景把成本从 12.58 美元压到 2.83 美元,降幅接近 77%。如果是真的,对跑 Agent 工作流的人来说挺省钱。不过正文没披露这个数字是在什么规模、什么模型上测的,也没说延迟有没有变差,这点先别太激动。整体是个有具体成本锚点的工具发布,不是大模型或平台级动作,所以分数放在 78–84 区间是合理的。

机器之心 · 公众号

ICML 2026:AutoMoT 用大小模型异步分工,在 Bench2Drive 和 nuScenes 上拿了双料第一

这篇文章本身被微信环境验证挡住了,正文内容没抓到,所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型,核心思路是把视觉语言模型和驾驶动作拆成两个专家:一个 4B 的 Qwen3-VL 负责看懂场景,一个 1.6B 的动作专家负责输出驾驶指令,而且两个模型是异步推理的,不用互相等。在...

推荐理由:我会先打个折:双 SOTA 听着唬人,但正文没披露 nuScenes 的具体指标,只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理,大模型负责想、小模型负责开,不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策,1.6B 的 AE 执行,这个组合在算力上挺省。不过论文没提实车验证,纯仿真成绩,这点先别太激动。整体看,对做自动驾驶算法的人有参考价值,但离出圈还差一口气,所以放在 featured 而不是更高一档。

AI HOT 精选

英伟达开源 Polar 框架,不改代码就能让 Codex 跑分涨近 6 倍

英伟达搞了个叫 Polar 的开源框架,专门解决一个实际问题:怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下,用强化学习(GRPO,一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法)去训练它们。Polar 的做法很取巧,它不碰工具本身的执行逻辑,而是在模型和工具之间的 API 接口上做文章,把对话记录、采样结果这...

推荐理由:英伟达开源 Polar,用 GRPO 训练小模型 Qwen3.5-4B,Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%,这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚,属于扎实的研究开源项,不是大模型或产品发布,所以放在 featured 档、82 分合理。

AI HOT 精选

xAI 把最快的编程模型 Grok Build 0.1 放上 API 公测了

xAI 发布了专门干编程活的模型 grok-build-0.1,现在通过 API 公测。这个模型主要用来做网页开发、修 bug 这类需要模型自己调用工具、跑流程的任务,跟 Grok Build 命令行工具背后是同一个模型。速度标称每秒 100 个 token 以上,价格是输入每百万 token 1 美元、输出每百万 token 2 美元。除了写代码,官...

推荐理由:我会先打个折:这是 0.1 公测版,正文没披露基准测试成绩、上下文窗口大小和具体任务成功率,所以别急着把它当成成熟产品。但亮点很实在——速度标到 100+ tokens/秒,定价也直接亮出来,输入 $1/M、输出 $2/M,对想试编码智能体的团队来说,成本门槛不高。xAI 明显在抢 Cursor/Claude 的开发者心智,这点从定位就能看出来。综合看,信息量够、有价格锚点,但缺验证数据,给 78 分、featured 不 p1 是合理的。

AI HOT 精选

AI 智能体时代的安全:一个终端可能跑着上万个智能体,每个都得有自己的身份

Lemonade 的安全负责人 Jonathan Jaffe 聊了聊当攻防双方都用上 AI 后,安全团队该怎么变。他提到一个终端上可能同时跑着 200 到 10000 个智能体,现在的身份和权限管理系统根本管不过来,必须给每个智能体一个独立身份,并在它执行动作时直接卡控策略。另外,AI 写的代码漏洞虽多,但修得也快,软件反而可能更皮实。安全团队本身也在...

推荐理由:这篇是活动评论,不是产品发布或研究论文,但终端智能体数量和身份管控模型这两个信息点很实在,对正在头疼智能体安全的团队有参考价值,放在 featured 里合适。

AI HOT 精选

Cognition AI 拿了超 10 亿美元,投前估值 260 亿,想把软件工程师效率提 10 倍

Cognition AI 新融了超过 10 亿美元,投前估值 260 亿美元。它的年化收入一年里从 3700 万美元涨到约 4.92 亿美元,涨了十几倍。核心产品 Devin 被定位成能自主干活的初级工程师,不是只补代码,而是能自己规划、测试、部署,走完多步骤流程。公司不绑死一家模型,既用自己的模型,也接 OpenAI 和 Anthropic 的大模型...

推荐理由:这条消息硬数字够多,估值和收入增速都摆在那,Devin 的定位也从“写代码助手”变成了能自己规划、测试、部署的初级工程师,对从业者的冲击感很直接。不过信息源单一,正文没披露具体投资方和估值计算细节,所以没给到行业地震级的高分。

AI HOT 精选

Anthropic 公开了用 Claude Opus 扫代码漏洞的六步流程,扫开源项目找到 1596 个漏洞,修了 97 个

Anthropic 在这篇博客里讲了他们怎么用自家最强的 Claude Opus 模型去扫代码安全漏洞。整个流程分六步:先做威胁建模(搞清楚代码可能被怎么攻击),再把代码放进沙盒隔离运行,接着让模型找漏洞,找到后人工验证是不是误报,然后排优先级,最后出修复方案。他们拿这套流程去扫开源项目,截至 2026 年 5 月 22 日共报出 1596 个漏洞,其...

推荐理由:HKR 三项都站得住:Anthropic 公开了 Claude Opus 做源码安全审计的完整工作流,并附上 1,596/97 的漏洞与修复数据,不是 PR 稿。没给 85 以上是因为这不算新模型或平台级能力发布,更像现有能力的工程化实践报告。

AI HOT 精选

Cognition 拿了 10 亿美元融资,估值冲到 260 亿,自称全球最大独立智能体实验室

Cognition 宣布完成超 10 亿美元融资,估值 260 亿美元,领投方包括 Lux Capital 和 General Catalyst。公司说今年企业用量涨了 10 倍以上,年化收入做到 4.92 亿美元。他们两年前推出的 Devin 定位是第一个 AI 软件工程师,这次还强调自己在编码智能体和代码审查上领先,Peter Thiel 也投了重...

推荐理由:Cognition 这轮拿了超过10亿美元,估值直接干到260亿,年化收入也接近5亿美元,说明编程智能体赛道正在快速商业化。我会先打个折:正文没披露具体投资方和资金用途,估值这么高,后续能不能撑住还得看实际产品落地和竞争。不过“用量一年涨10倍”这个数字如果是真的,确实挺猛,对做开发工具和智能体的同行来说,压力不小。

AI HOT 精选

OpenAI 产品现在能直连你内网的 MCP 服务器了

OpenAI 给 ChatGPT、Codex 和 Responses API 加了个能力:可以走纯出站 HTTPS 去调你团队放在内网的 MCP 服务器。服务器不用暴露到公网,模型这边只往外发请求,不接收入站连接。正文没提延迟和鉴权细节,实际部署前最好先测一下链路稳定性。

推荐理由:我会先打个折:正文没披露权限控制怎么配、收不收费、什么时候全量推,这些缺口让实际落地还有变数。但方向很明确——让模型直接进公司内网干活,而且用仅出站 HTTPS 绕过了安全团队最头疼的入站暴露问题。对正在评估 AI agent 接内部系统的团队来说,这是个值得马上跟进的消息。

AI HOT 精选

Anthropic 发布 AI 智能体零信任安全框架

Anthropic 发了篇博客,讲企业里用自主 AI 智能体(能自己调用工具、读写记忆的模型)该怎么搞安全。核心判断是:前沿模型把漏洞利用的时间从几个月压到了几小时,老一套安全流程跟不上。文章给了一套三层零信任架构,把智能体拆成身份层、工具层和记忆层分别做权限最小化,还列了八个阶段的落地步骤。威胁模型里重点提了提示注入、工具投毒和记忆投毒这三种攻击方式...

推荐理由:Anthropic 这份零信任框架把攻击速度的变化说得很直白——前沿模型能把漏洞利用周期从几个月压到几小时,这个数字本身就是最好的警示。三层架构和八阶段流程让方案有了骨架,提示注入这些威胁也点得实在。我会先打个折:正文没披露具体验证数据或落地案例,目前更像一套设计原则而非实测报告。但安全、智能体、权限这几个话题叠加,对正在推 agent 上线的团队来说,参考价值不低。

彭博科技

Meta 开始对 AI 聊天机器人收订阅费,想靠用户付费来填 AI 投资的坑

Meta 第一次给普通消费者用的 Meta AI 加上了付费订阅。说白了就是他们砸了几千亿美元搞 AI,现在想从用户口袋里直接回收一部分,不再只靠广告。但正文没公布具体价格、什么时候上线、在哪些国家推出,也没说付费版比免费版多了哪些功能。这点先别太激动,等细节出来再看值不值。

推荐理由:Bloomberg 报了 Meta 第一次给 Meta AI 上消费者订阅,目的是给 AI 支出找补。我会先打个折:正文没写价格、什么时候上线、付费功能比免费强在哪,所以现在只能当个方向信号看,别太激动。但方向本身够硬——从纯烧钱到试着收钱,对盯着 AI 变现的人来说值得扫一眼。