跳到正文
MIT Technology Review · AI

AI跑分这套玩法已经失灵了,我们得换个法子

AI benchmarks are broken. Here’s what we need instead.

作者直接点明:现在给AI打分的基准测试,和实际用起来的场景完全是两码事。那些98%准确率的漂亮分数,一旦塞进医院放射科这种需要多科室会诊、标准随时变动的真实流程里,反而会拖慢工作节奏。她研究了2022年以来英美亚多个行业的AI落地情况,提出一套叫HAIC的评估思路,核心是看AI在团队协作、长时间工作流里的表现,而不是单次答题。文章举了一个英国医院202...

推荐理由:这篇文章不是模型发布或技术报告,是一篇观点犀利的评论。我会先打个折:它没有给出可跑的 HAIC 测试集,但它的价值在于把“评测坏了”这个共识讲透,并给出四个具体改造方向——盯协调质量、盯错误能不能被发现、盯上下游后果,而不是盯着一个漂亮数字。两个长期案例让论点站得住,对正在搭内部评测体系的团队有直接参考意义。

读原文 ↗导出 Markdown