# IBM 在 Hugging Face 上线开放智能体排行榜，直接对比整套系统谁更省钱能干

> 原标题：The Open Agent Leaderboard（开放智能体排行榜）

- 来源：AI HOT 精选
- 发布时间：2026-05-18T14:12:58.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23637
- 原文：https://huggingface.co/blog/ibm-research/open-agent-leaderboard

## 摘要

IBM Research 做了一个开放排行榜，不只看模型本身，而是把智能体整套系统（模型、工具、规划、记忆、纠错）拉出来比。它用六个不同场景的基准测试来打分，同时公布质量和运行成本，让你知道哪个方案真值得部署。正文没披露具体模型分数、数据集大小和评测日期。

## 推荐理由

我会先打个折：信息量其实不多，更像一个预告。但“开放智能体排行榜”这个动作本身有话题性，因为 agent 评测一直缺公开基准，IBM 把它挂上 Hugging Face，至少让对比有了个起点。正文没披露分数和数据集规模，所以别急着拿它当权威结论，先当个信号看。

## 锐评

IBM Research 在 Hugging Face 上发了一个开放排行榜，思路挺对：不只看模型本身，而是把智能体的整套系统——模型、工具、规划、记忆、纠错——打包一起测。它用六个不同场景的基准测试打分，同时公布质量和运行成本，让你知道哪个方案真值得部署，而不是只看谁分高。

但正文没披露具体模型分数、数据集大小和评测日期，这些信息缺口让榜单的参考价值打了折扣。没分数就没法判断差距是显著还是误差范围内，没数据集大小就不知道结论稳不稳，没日期就不知道时效性。另外，评测框架叫 Exgentic，代码和方法论文都公开了，这点对想复现或自己跑一遍的人比较友好。

目前看，这个榜单更像一个方法论示范，告诉你“应该这样比智能体”，而不是一份可以直接拿来选型的成熟报告。等他们把具体数据和更新节奏补上，实用性会高很多。
