# Agent 评测的下半场：为什么需要一个「活的」Benchmark？

> 原标题：Agent评测的下半场：为什么需要一个「活的」Benchmark？

- 来源：新智元 · 公众号
- 发布时间：2026-05-11T05:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17854
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652699411&idx=3&sn=dc9e47072fd295f8bcb5738aa632ef9b

## 摘要

这篇文章的正文被微信环境验证挡住了，实际内容没拿到。从标题和现有英文摘要看，它讨论的是 Claw-Eval-Live 这个基准测试，用 105 个任务测了 13 个前沿模型，表现最好的模型通过率也没超过 70%，HR 类任务平均通过率只有 6.8%。核心观点是静态评测不够用了，需要能动态更新的“活”基准来测 AI 智能体。但具体怎么个“活”法、任务怎么...

## 推荐理由

HKR 三项都成立：活的 benchmark 这个切入点具体，不是又一篇刷榜通稿；数据量够，105 道任务和 13 个模型的覆盖面说得过去，HR 任务 6.8% 的通过率尤其扎眼；它踩中了 Agent 从 demo 到落地之间那个“到底能不能用”的信任问题。Claw-Eval-Live 本身还没经过大规模实战检验，所以放在 featured 偏低的位置比较合适。

## 锐评

这条新闻的核心信息来自标题和摘要，正文被微信的验证页面挡住了，实际内容没拿到。从现有信息看，Claw-Eval-Live 这个基准测试想解决一个老问题：静态评测分数高，一上线就拉胯。它用 105 个任务测了 13 个模型，最强选手通过率也没超过 70%，HR 类任务更是惨到平均 6.8%——相当于让 AI 处理人事流程，十次里有九次搞不定。

这个数字挺直观，但缺的东西也多。正文没披露这 105 个任务具体是什么、怎么定义“通过”、模型跑的是单轮还是多轮交互。HR 任务通过率低，可能是因为涉及多步操作和权限判断，也可能只是任务设计得特别刁钻。另外，“活的”基准具体怎么更新、更新频率、会不会引入人为偏差，这些关键设计都没展开。

我会先打个折：6.8% 这个数字抓眼球，但得看任务是不是故意选了模型的软肋。如果后续能放出任务样例和评测细节，才值得认真对待。
