跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 701–720 条 · 共 1,465 条

6月1日星期一

AI HOT 精选

NVIDIA 发布工厂运营蓝图 FOX,让 AI 智能体接管产线管理

NVIDIA 在台北 GTC 上推出了一个叫 FOX 的工厂运营蓝图,相当于给工厂装了一套能自主管产线的“AI 大脑”。富士康已经用它搭了一个叫 MoMClaw 的多智能体系统,把摄像头、传感器和产线数据喂给多个 AI 智能体,让它们协同干活。官方说,这套系统能把查找产线故障根因的时间缩短 80%,但正文没披露这个数字是在什么规模的产线、什么类型的故障...

推荐理由:英伟达在 GTC 台北丢出一套工厂运营蓝图 FOX,让多个 AI 智能体组团进产线干活。富士康已经拿它搭了 MoMClaw 系统,号称能把找问题根因的时间砍掉 80%。我会先打个折——这是厂商博客放出来的预期数字,不是实测报告,正文也没披露具体产线、样本量和对比基准。但方向本身踩中了现在企业最关心的:智能体能不能真进业务流程降本,所以还是值得看一眼。

AI HOT 精选

NVIDIA 发布 RTX Spark 本地 AI 电脑,1 petaflops 算力跑智能体,llama.cpp 优化让 Qwen 27B 吞吐翻倍

NVIDIA 在 Computex 上发了台叫 RTX Spark 的 Windows 电脑,专门在本地跑 AI 智能体。配置给得挺足:1 petaflops AI 算力、128GB 统一内存,意思是大模型不用来回倒腾显存。安全方面,他们和微软合作搞了个 OpenShell 运行时,用 Windows 新的安全接口把智能体锁在设备本地跑,数据不出机。性...

推荐理由:HKR 三项都踩中了:NVIDIA 把 RTX Spark 定位成本地智能体机器,给了 1 petaflops、128GB 统一内存和 llama.cpp 上 Qwen 27B 吞吐最高 2 倍的硬数字。因为是厂商博客发布,我会先打个折,分数落在 78–84 区间合理。

AI HOT 精选

MiniMax 开源 M3 模型:一个模型搞定编程、100 万 token 上下文和原生多模态

MiniMax 把 M3 模型开源了,权重公开可下载。它把三个能力塞进了一个模型里:编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边(SWE-Bench Pro 得分 59.0%),能处理 100 万 token 的超长上下文,还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

推荐理由:MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案,上下文窗口拉到100万token。最实在的点是MSA注意力机制,每token计算成本降到前代的1/20,长文本推理能省不少钱。编码和Agent跑分看着不错,但正文没给出具体对比对象和测试细节,这点先别太激动。整体是一次有诚意的开源发布,信息量够,但验证还缺一环,所以放在featured而不是P1。

AI HOT 精选

Qwen3.7-Plus:一个能看图、写代码、操作界面的多模态智能体模型

Qwen 发布了 Qwen3.7-Plus,把视觉理解和语言能力塞进同一个模型里,让它能直接看懂屏幕、操作手机 App、根据截图写前端代码,还能在命令行和图形界面之间来回切换干活。在 Terminal Bench 2.0 终端任务上拿了 70.3 分,比 Opus 4.6 Max 和 DeepSeek-V4-Pro Max 都高;在 Deep-Plan...

推荐理由:我会先打个折:正文只给了功能清单,没给任何硬指标。7 类能力听着挺全,聊天、看图、读文档、搜网页、调工具都塞进去了,但没参数、没价格、没上线日期,等于只看了个目录。这点先别太激动。不过 Qwen 这条线每次更新都会牵动国内从业者的注意力,尤其是把多模态和智能体绑在一起推,说明他们想在应用层抢身位。信息虽然薄,但话题本身够热,放在 featured 里提醒大家盯后续是合理的。

AI HOT 精选

MWC26 上海要办人形机器人点球大战,宇树科技等 8 支队伍上场,全程自主、不靠遥控

GSMA 宣布在 2026 年 6 月 24 日至 25 日的 MWC 上海搞一场人形机器人点球比赛,这是全球头一回。8 支国内具身智能团队参加,包括宇树科技、灵心巧手等。规则参照世界杯点球,双方各罚 5 轮,射门和守门的都是机器人,平局后一球定胜负。关键限制是机器人必须自己识别球和守门员位置、决定射门角度并控制发力,不能由人遥控,也不能跑预设脚本。这...

推荐理由:我会先打个折:这是活动预告,不是模型发布或可复现的测试结果,所以分数压在 72–77 之间。但选题本身够抓人,规则里“不许遥控、不许脚本”把门槛拉高了,不再是展台走秀。正文没披露具体评分标准、场地条件和机器人硬件细节,所以别急着当技术里程碑看。如果现场真能稳定自主对抗,那才算数。

5月31日星期日

AI HOT 精选

苹果 WWDC 要拿 Gemini 蒸馏出的小模型跑在 iPhone 上,复杂问题还是会甩给谷歌云

下个月 WWDC 苹果会展示 Siri 和端侧 AI 的升级,核心思路是把谷歌 Gemini 模型“蒸馏”成一个小号版本,直接在 iPhone 芯片上本地跑,主打隐私和省 token 费。但整个技术栈对外依赖很重:本地模型源自 Gemini 蒸馏,手机处理不了的复杂请求会路由到谷歌云,还用了英伟达的机密计算。苹果之前承诺的 Private Cloud ...

推荐理由:这条消息我会先打个折,因为目前只有单一信源,正文没披露模型参数量、延迟、成本或合同细节。但它的信息量对从业者来说很实在:苹果在 WWDC 前被曝出用 Gemini 蒸馏模型救急,本地跑小模型保隐私,重活还是得走 Google 云和 Nvidia 机密计算,等于承认自研大模型没跟上。这个技术栈组合本身就说明苹果在端侧 AI 上选择了外部依赖,跟它一贯的全栈控制路线反差很大,所以给了 82 分,放在 featured 位置。

r/LocalLLaMA

PolyRange:一个防考题泄露、专测 AI 攻击能力的靶场,每次出题都不一样

PolyRange v1.0 把 OWASP 测试指南里的 12 大类、84 种攻击手法做成了动态靶场。它不靠固定题库,而是每次部署时让一个大模型现场生成新靶机和防守策略,分两档难度,最后用“AI 提交攻击结果、裁判机验证”的方式打分。整套环境一条命令就能在 Fly.io 或 Docker 上跑起来。正文没披露具体评测数据和成本,但思路很明确:防止模型...

推荐理由:PolyRange 把网页安全靶场做成了会自己换题的 agent 评测。每次部署由大模型新生成任务,不是死题库,防污染这点做得比较彻底。覆盖 84 个 WSTG 类、12 个 OWASP 类别,两档防御加 flag 判定,规则清楚。信息源单一,目前只有 Reddit 帖子,正文没披露实际跑分数据和 agent 通过率,所以分数先打 78,等有实测结果再往上调。

r/LocalLLaMA

不用改代码,让 OpenAI Codex 桌面客户端接任意模型和供应商

Reddit 用户 thibautrey 分享了一个三步走的方法:编辑 Codex Desktop 的 config.toml 配置文件,存好 API 密钥,再用一个叫 multicodex 的代理别名把 gpt-5.3-codex 这个模型名映射到 MiniMax-Latest。代理跑在本地 127.0.0.1:1455,会把返回的模型名伪装成 gp...

推荐理由:这是一条可复现的开发者操作流,不是官方发布。我会先打个折:正文没披露 MiniMax-Latest 的具体成本和延迟,也没说 proxy 稳定性如何,所以别急着在生产环境照搬。但 hook 很直接——不改代码就能在 Codex 桌面端用别的模型,配置细节也够落地,对想省钱或换模型的人有实际参考价值。

机器之心 · 公众号

人大高瓴发了一篇40页综述,专门讲怎么给大模型打分

这篇综述把“评分标准(Rubrics)”这件事拆成了五个部分来讲:定义、怎么构建、怎么用来训练、怎么用来评估、以及还没解决的难题。它想回答一个很实际的问题:在模型能自己调用工具、走流程干活的 Agent 时代,光看答案对不对已经不够了,得有一套更细的尺子来衡量“好答案”到底好在哪里。正文没披露具体的实验数据,更像是一张研究地图,帮从业者快速看清这个方向...

推荐理由:这篇综述没发布新模型或产品,但 40 页的框架对 agent 评测很有用,我会先打个折,放在 featured 档。正文没披露具体实验数据,更像文献梳理,但问题意识够强,从业者能直接拿来对照自己的评估流程。

机器之心 · 公众号

微软开源 SkillOpt:像训练神经网络一样,自动优化给 AI 智能体看的技能说明书

微软放出了一个叫 SkillOpt 的开源框架,一周就在 GitHub 上拿了 3300 多颗星。它的思路挺直接:不改模型本身的参数,而是像做文本版梯度下降一样,自动迭代优化那些写给 AI 智能体看的“技能文档”。论文里的实验覆盖了 7 个目标模型、6 个评测基准和 3 种执行环境,总共 52 种组合,结果要么最好,要么并列最好。不过正文因为访问限制没...

推荐理由:微软开源的 SkillOpt 把 agent 技能文档当成可训练的文本参数,像训神经网络一样去优化技能描述,这个思路挺新鲜。我会先打个折:论文说在 52 个组合里做到最优或并列最优,但正文没披露具体对比基线和误差范围,这点先别太激动。不过一周 3.3k star 说明 agent 工程圈确实被技能维护和评估成本折磨很久了,一个能自动优化技能文档的工具,哪怕只是省掉一部分手工调 prompt 的活,也值得关注。

新智元 · 公众号

复旦系团队发布时空一体世界动作模型 STI-WM,称能同时吃进 RGB、点云和本体感知数据做百秒级任务规划

这篇文章来自微信公众号,但页面被环境验证挡住了,正文内容完全看不到。标题和摘要里提到的“复旦铁三角”和“最优物理 AI 路径”都是原文的说法,具体技术细节、实验数据和模型架构都没法核实。已知信息是:一个叫 STI-WM 的模型,主打时空一体的世界动作建模,用在机器人上,支持 RGB 图像、点云和机器人自身状态感知三种输入,能做上百秒的任务规划。另外还提...

推荐理由:这篇东西我会先打个折——全是公司自己说的,没给公开 benchmark 也没说模型能不能复现。但信息量确实不小:STI-WM 把视觉、点云和机器人自身状态揉进一个模型里,号称一次能规划上百秒的动作,这比现在多数 demo 里几秒的规划长得多。半年融了 5 轮、Pre-A 轮 3 个亿,还拉了 NVIDIA 站台,资本侧的信号比技术侧更实。对做机器人落地的人,这条至少能看出一条技术路线和资源密度,所以放在 featured 门槛上。

量子位 · 公众号

复旦和通义搞了个 ToolCUA,专门教 Agent 在屏幕上选对工具

现在给 Agent 塞一堆工具,它经常不知道该点哪个。复旦和通义实验室提出了一套叫 ToolCUA 的训练方法,核心是用约 4000 个合成工具和 18 万步的“屏幕操作+工具调用”交叉轨迹来训练模型。他们训出来的 ToolCUA-8B 在 OSWorld-MCP 基准上跑到了 46.85% 的准确率。不过正文因为微信环境验证没抓到,具体训练细节和对比...

推荐理由:这篇文章抓了一个实际工程里的矛盾:工具越多,Agent 越不会选。我会先打个折,46.85% 的准确率不算高,但考虑到是 4k 工具的环境,这个数字说明问题确实难。18 万步合成轨迹是亮点,意味着训练数据不用全人工标,成本上友好一些。正文没披露推理延迟和实际部署的资源消耗,这点先别太激动。整体是一篇有痛点的研究发布,不是大模型或产品级发布,所以放在 featured 里合适。

量子位 · 公众号

英伟达、微软、Arm 同发预告,传老黄自研 CPU 笔记本 N1X 要来了

三家公司在同一天发了同一张“PC 新纪元”的预告图,指向一台传闻中由英伟达主导设计的笔记本 N1X。目前流出的配置是 20 核 Arm 架构 CPU、Blackwell GPU、6144 个 CUDA 核心和 128GB LPDDR5X 统一内存,听起来像一台给 AI 开发者准备的移动工作站。不过正文没披露具体跑分和实测数据,内存带宽和 x86 转译效...

推荐理由:我会先打个折:这目前是三家同一天发暗示拼出来的硬件传闻,发布日期、价格、量产计划正文都没给。但“英伟达自研 CPU 塞进笔记本”这个组合拳,加上 128GB 统一内存这种能跑大模型的规格,确实值得当一条强信号来看。先别太激动,等实锤。

AI HOT 精选

特斯拉 FSD V14.3.3 用 4 天 21 小时横穿加拿大,6051 公里全程没让人碰方向盘

一群电动车爱好者开着搭载 FSD V14.3.3 的特斯拉,从温哥华一路跑到哈利法克斯,6051 公里零接管、零退出。变道、过施工路段、甚至每次进超充站自动倒车泊车,全是系统自己干的。这个版本放宽了对驾驶员盯路的判定,长途开下来没那么累。不过得说清楚,这仍是 L2 级辅助驾驶,法规上要求人随时准备接管。正文没提途中遇到的极端天气具体有多糟,也没交代是否...

推荐理由:我会先打个折:这是特斯拉自己放出来的单次行程,没有第三方验证,也没说清路线里高速和城市比例、天气变化、有没有施工路段这些容易翻车的细节。但 6051 公里零干预这个数字本身够硬,版本号也明确,对从业者来说是个可复现可质疑的靶子。分数停在 82 是因为它给了结果却没给边界条件,没法判断这到底是常态水平还是挑了个好天气跑出来的。

5月30日星期六

TechCrunch · AI

我让谷歌的 24 小时 AI 助手 Gemini Spark 干了一天活,它确实挺有用

TechCrunch 的编辑实测了谷歌新推出的 Gemini Spark,把它当成一个全天候 AI 助手来用,主要干了整理邮件摘要和规划本地活动这两件事。体验下来觉得确实能帮上忙,但文章没搞懂谷歌为什么要把这个功能单独做成一个产品,而不是直接塞进现有的 Gemini 里。正文没披露这东西什么时候正式上线、要不要另外收费。

推荐理由:我会先打个折:正文没披露价格和发布时间,所以不能当产品发布看。但亮点在于,这是一篇上手实测,不是通稿。编辑用“actually pretty useful”收尾,说明 Gemini Spark 在收件箱摘要和本地活动规划这两个场景里跑通了,没翻车。对做 agent 的人来说,这种“替你干活”的体感比跑分重要。信息缺口明显,但反转叙事和具体场景撑住了 featured 的分数。

新智元 · 公众号

Opus 4.8 算了一夜,把 1170 亿人的投胎概率做成了模拟器

这篇文章的正文被微信环境异常页挡住了,实际内容没抓到。从标题和已有英文摘要看,沃顿商学院教授 Ethan Mollick 用 Claude Opus 4.8 生成了一个叫“历史之幕”的网站,把人类历史上约 1170 亿次出生做成加权随机模拟,跑了 4000 轮蒙特卡洛来估算你投胎到不同地区和时代的概率。但具体怎么算的、模型代码怎么写的、有没有幻觉或偏差...

推荐理由:HKR 三项都成立:Mollick 的投胎模拟器是个有梗的钩子,不是常规的“模型又变强了”;1170亿人口和4000轮模拟给了可验证的数字;对开发者来说,这种一夜搭出复杂原型的效率比跑分更有说服力。这不是 Anthropic 官方发布,所以留在 featured 低位没问题。

FT · 科技

英国军方考虑允许 AI 自主发动致命打击,不再需要人类批准

FT 这篇报道的标题很炸,但正文被付费墙挡住了,只看到订阅页面。标题说英国军方正在研究让武器系统在没有人类批准的情况下执行致命打击。具体是哪种武器、在什么条件下可以自主开火、法律框架怎么搭、有没有时间表,这些关键信息正文都没披露。光看标题,这更像是一个政策方向的试探,离真正部署还远,先别太激动。

推荐理由:FT 标题抛出一个很猛的判断,但点进去只有订阅提示,等于只给了一个概念,没给任何能验证的细节。我会先打个折:话题性够强,能让人立刻意识到“人在回路”这条底线正在被试探,所以重要性和传播力都高。但信息缺口太大,没法判断这是政策试探、技术验证还是媒体标题操作,这点先别太激动。

量子位 · 公众号

人大和至知研究院开源了 Claw Agent 的全套训练方案,连数据带模型和评测一起给了

人大和至知研究院放出了一个叫 ClawGym 的 Agent 训练框架,把数据、训练代码和模型权重都开源了。他们合成了 13500 条可执行的任务当训练数据,又做了 200 条任务的基准测试集。用这套东西训出来的 ClawGym-30B-A3B 模型,在他们自己的 ClawGym-Bench 上拿了 56.82 分,比 Qwen3-235B-A23B ...

推荐理由:这条消息对 Agent 开发者很实用。ClawGym 把数据、代码、模型检查点一起打包开源,不是又一个只有排行榜的项目。13.5K 合成任务规模不算大,但 200 个评测任务和 56.82 的得分给了明确的起点。我会先打个折:正文没披露合成任务的质量验证细节,也没说这个分数在实际业务场景里对应什么水平,所以别急着对标生产环境。但作为开源基建,它降低了复现和改造的门槛,值得关注。

机器之心 · 公众号

英伟达和清华的 γ-World 把世界模型从单机改成了联机,登顶 HuggingFace 日榜

这篇推文本身因为微信环境验证没抓到正文,我只能根据已有的英文摘要和标题来还原。γ-World 是一个多智能体世界模型,核心是把多个 AI 角色放在同一个虚拟环境里互动。它用了一种叫“单纯形位置编码”的方法和 hub token 机制,把多个智能体之间的交互计算成本从平方级降到了线性级。说人话就是:以前每加一个角色,系统要算它和所有其他角色的关系,开销涨...

推荐理由:我会先打个折:这是研究发布,还没看到大规模落地验证,但技术点够具体。Gamma-World 解决的是多个 AI 同时在一个世界里交互时计算量爆炸的问题,用正单纯形位置编码让每个智能体知道彼此位置,再靠 hub token 汇总信息,把原本 O(n²) 的复杂度压到 O(n)。8 个玩家延迟压到 4.5ms 这个数挺实在,说明小规模场景已经能跑顺。不过正文没披露更多玩家数下的表现,这点先别太激动。整体属于有干货、有数字、方向对路的研究,给 featured 合理。

AI HOT 精选

Codex 现在能自己管自己的聊天线程和并行任务了

OpenAI 的 Codex 界面新增了对话线程管理能力,可以自己创建、搜索、整理和固定聊天线程,还能为并行任务启动工作树。这条信息来自 X 上的用户分享,正文没披露具体实现方式、准确率或延迟数据,我会先打个折——目前看起来更像一个便利功能,而不是底层模型能力的升级。

推荐理由:HKR 三项都过:Codex 拿到了具体的线程管理和并行工作树机制,对编码 Agent 用户有实际价值。正文没披露适用范围、定价和性能数据,所以我会先打个折,放在 featured 偏低的位置。