IBM 在 Hugging Face 上线开放智能体排行榜,直接对比整套系统谁更省钱能干
The Open Agent Leaderboard(开放智能体排行榜)
IBM Research 做了一个开放排行榜,不只看模型本身,而是把智能体整套系统(模型、工具、规划、记忆、纠错)拉出来比。它用六个不同场景的基准测试来打分,同时公布质量和运行成本,让你知道哪个方案真值得部署。正文没披露具体模型分数、数据集大小和评测日期。
推荐理由:我会先打个折:信息量其实不多,更像一个预告。但“开放智能体排行榜”这个动作本身有话题性,因为 agent 评测一直缺公开基准,IBM 把它挂上 Hugging Face,至少让对比有了个起点。正文没披露分数和数据集规模,所以别急着拿它当权威结论,先当个信号看。