# AI跑分这套玩法已经失灵了，我们得换个法子

> 原标题：AI benchmarks are broken. Here’s what we need instead.

- 来源：MIT Technology Review · AI
- 发布时间：2026-03-31T12:01:08.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3496
- 原文：https://www.technologyreview.com/2026/03/31/1134833/ai-benchmarks-are-broken-heres-what-we-need-instead/

## 摘要

作者直接点明：现在给AI打分的基准测试，和实际用起来的场景完全是两码事。那些98%准确率的漂亮分数，一旦塞进医院放射科这种需要多科室会诊、标准随时变动的真实流程里，反而会拖慢工作节奏。她研究了2022年以来英美亚多个行业的AI落地情况，提出一套叫HAIC的评估思路，核心是看AI在团队协作、长时间工作流里的表现，而不是单次答题。文章举了一个英国医院202...

## 推荐理由

这篇文章不是模型发布或技术报告，是一篇观点犀利的评论。我会先打个折：它没有给出可跑的 HAIC 测试集，但它的价值在于把“评测坏了”这个共识讲透，并给出四个具体改造方向——盯协调质量、盯错误能不能被发现、盯上下游后果，而不是盯着一个漂亮数字。两个长期案例让论点站得住，对正在搭内部评测体系的团队有直接参考意义。

## 锐评

这篇文章的核心判断很直接：现在主流的AI基准测试和实际使用场景严重脱节。作者Angela Aristidou从2022年起研究了英美亚多个行业的AI落地情况，发现那些在静态测试里拿98%准确率的模型，一旦放进医院放射科这种需要多科室会诊、报告标准随时变动的真实流程里，反而让工作人员多花时间去核对和修正，拖慢了整体节奏。她提出的HAIC评估思路，核心是把考核点从“单次答题得分”转向“在团队协作和长时间工作流里的表现”，看的是协调能力、错误可发现性，以及AI输出对下游环节的连锁影响。

文章举了一个英国医院从2021到2024年的跟踪案例，还有一个跨度18个月的人道主义援助案例，但正文没披露具体样本量和量化对比数据，比如到底多花了多少时间、错误率变化多少。这点让论证的力度打了个折扣。另外，HAIC目前更像一个评估框架的提议，还没有给出可复现的指标和测试集，离能落地成行业标准还有距离。

对从业者来说，这篇文章的价值在于提醒：选模型时别只看排行榜上的高分，得先想清楚它要被塞进什么样的工作流、和多少人协作、出错了能不能被及时发现。如果供应商只拿单点准确率说事，可以先打个折，要求看它在连续任务和团队环境里的表现数据。
