# Claude Mythos 在 METR 基准上连续跑了 3 小时 6 分钟，比专家预测的年底时间提前了大半年

> 原标题：专家预测年底才到，Claude Mythos今天就跑出3小时6分！

- 来源：新智元 · 公众号
- 发布时间：2026-06-04T11:17:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34763
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652705015&idx=2&sn=23955f4f6d14f0d4f9eb777d596eb634

## 摘要

Anthropic 的 Claude Mythos 在 METR 的自主任务测试里撑了 186 分钟，成功率 80%。这个时长刚好落在专家们之前预测的 3 到 4 小时中位数区间，但预测的时间点是 2026 年底，现在提前到了。正文因为需要验证码没抓到具体细节，不知道任务类型、失败原因和是否有人工干预，所以这个 80% 成功率先打个折看。

## 推荐理由

这条消息的钩子很直接：预测年底才到的水平，今天就被打出来了。我会先打个折——正文没披露模型规模、任务类型和可复现细节，所以不能当完整评测看。但 80% 成功率加 186 分钟连续跑，对从业者来说是个可感知的信号：agent 的自主时长在拉长，而且比行业预期快。安全焦虑和落地想象空间同时被触发，适合放 featured 位置。

## 锐评

这条消息值得关注的点是时间提前量。METR 的自主任务测试衡量的是模型在没有人类插手的情况下能连续干活多久，之前专家们预测 3 到 4 小时的中位数要到 2026 年底才会出现，现在 Claude Mythos 在 6 月初就跑出了 3 小时 6 分，提前了大约半年。

不过信息缺口很大。原文因为需要验证码，实际内容没抓到，我们不知道这 186 分钟里具体做了什么类型的任务，是写代码、查资料还是做表格，也不知道那 20% 的失败是因为模型卡住了、输出乱码了，还是任务本身定义有问题。更关键的是，正文没披露测试过程中有没有人工干预，比如中间是否有人重新提示或纠错。如果存在隐性的人类辅助，这个 186 分钟就要大打折扣。

另外，METR 的测试环境和真实业务场景之间还有距离。实验室里的连续运行和在生产环境里稳定跑几个小时是两回事。建议等 Anthropic 或 METR 放出完整报告后再做判断，现在只能说方向是对的，但数字还不能直接拿来当采购依据。
