# Claude Mythos 在 METR 长任务评测里拿到 50% 成功率，对应人类 16 小时的工作量

> 原标题：刚刚，Claude Mythos打爆AI评测天花板！超指数狂飙，2027奇点加速

- 来源：新智元 · 公众号
- 发布时间：2026-05-11T05:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17852
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652699411&idx=1&sn=e11e9bab250663e0c38d5db2e3cdbd69

## 摘要

METR 的 Time Horizons 测试里，Claude Mythos 预览版在人类需要 16 小时才能完成的任务上，成功率达到了 50%。不过整个测试集一共 228 个任务，只有 5 个任务的时间跨度超过 16 小时，所以这个成绩能说明它在长任务上有进步，但样本太少，还测不出它在更长时间尺度上的真实水平。

## 推荐理由

我会先打个折：50% 成功率听起来很猛，但只测了 5 个超过 16 小时的任务，样本太少，不能当定论。正文自己也说更长区间样本不足。所以 2027 奇点加速这种说法先别太激动。不过这个结果确实把 AI 评测的天花板往上顶了一截，从跑分转向了按人类耗时衡量的任务，对做智能体和安全的团队有直接参考价值。整体给 82 分，因为数据有料但外推太远，不算当天必读的头条。

## 锐评

这条消息最值得看的是 METR 的 Time Horizons 测试终于有了一个能跑长任务的模型。Claude Mythos 预览版在人类需要 16 小时才能完成的任务上，成功率达到了 50%，说明它在长时间、多步骤的自主干活能力上确实有进步。但整个测试集一共 228 个任务，超过 16 小时的只有 5 个，这个 50% 就是 5 道题里做对了两三道，统计上很不稳。METR 自己也说样本不够，测不出它在更长时间尺度上的真实水平。

另外，正文因为微信环境验证问题没拿到完整内容，不知道 Anthropic 有没有披露这个预览版的具体规模、成本，也不知道它在更常见的短任务上表现如何。光靠这 5 个长任务就说“超指数狂飙”或者“2027 奇点加速”，属于把一个小样本结果当成了趋势。我会先打个折，等 METR 放出更多长任务数据再说。
