# AI 圈被误解最深的一张图：METR 的时间线图到底在说什么

> 原标题：This is the most misunderstood graph in AI

- 来源：MIT Technology Review · AI
- 发布时间：2026-02-05T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3915
- 原文：https://www.technologyreview.com/2026/02/05/1132254/this-is-the-most-misunderstood-graph-in-ai/

## 摘要

METR 这张图横轴是模型发布时间，纵轴是“时间线”——一个他们自己发明的指标，指模型在编程任务上能做到 50% 成功率时，对应的人类用时。Claude Opus 4.5 在 2025 年 12 月测出来大约是 5 小时，但 METR 自己给的误差范围是 2 到 20 小时，所以别拿一个数字当定论。这张图主要测的是写代码，不是通用 AI 能力，而且“5...

## 推荐理由

这篇文章不是新模型或产品发布，而是对一张流行图表的权威解释性评论。它把 METR 图里容易误读的地方拆得很清楚：5小时不是模型自己能跑5小时，而是人类做同样任务要花的时间；图主要测编码任务，且以50%成功率划线。这些细节对盯着 AGI 进度的人有用，但信息增量属于澄清而非首发，所以放在 featured 低段位。

## 锐评

METR 这张被疯传的图，横轴是模型发布时间，纵轴是他们自己定义的“时间线”——模型在编程任务上做到 50% 成功率时，对应的人类用时。Claude Opus 4.5 在 2025 年 12 月测出来大约是 5 小时，但 METR 自己给的误差范围是 2 到 20 小时，所以这个数字本身就不牢靠。

这张图主要测的是写代码，不是通用 AI 能力，而且“5 小时”指的是人类完成同类任务的时间，不是模型能自主跑 5 小时。METR 的研究员自己也说，很多人对这张图解读过度了。他们甚至专门写了博客列限制条件，但作者不乐观，觉得“不管我们怎么加说明，炒作机器都会把限定词全删掉”。

正文没披露这个趋势线具体怎么拟合的，也没说不同模型测试时的任务集是否一致。如果真想拿这张图做判断，至少得知道误差范围、任务类型占比，以及成功率 50% 这个阈值挪一挪曲线会怎么变。
