# 清华团队花约10万美元、一周时间，让系统自动刷出105个SOTA

> 原标题：刷榜只是体力活！清华消费10万块，一周「肝」出105个SOTA

- 来源：新智元 · 公众号
- 发布时间：2026-04-29T12:48:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12339
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652696367&idx=3&sn=2d22c09d1f00f30a1f4fc080dccc009f

## 摘要

清华徐丰力团队和北京中关村实验室搞了个叫AutoSOTA的系统，放养式跑了一周，烧掉约220亿token，产出了105个所谓的最优结果。系统里塞了8个智能体，分别负责搭环境、修bug、排任务、想点子、做审计。每完整跑一轮平均5小时。最关键的是它设了条红线：不准改评估脚本和数据划分，靠这个来保证结果能复现。不过正文没披露具体在哪些任务上拿了SOTA，也没...

## 推荐理由

HKR三项全中：有具体数字和机制描述，审计约束让说法可验证。保留84分是因为这仍是单篇二次报道，不是模型或产品级发布，但选题和切入角度对从业者足够有信息量。

## 锐评

清华徐丰力团队和北京中关村实验室搞了个叫AutoSOTA的系统，放养式跑了一周，烧掉约220亿token，产出了105个所谓的最优结果。系统里塞了8个智能体，分别负责搭环境、修bug、排任务、想点子、做审计。每完整跑一轮平均5小时。最关键的是它设了条红线：不准改评估脚本和数据划分，靠这个来保证结果能复现。不过正文没披露具体在哪些任务上拿了SOTA，也没说跟哪些基线比。10万块的成本听着不高，但如果只是在小众benchmark上刷分，那这钱花得值不值就得打个问号。另外，系统靠智能体自己修bug、自己审计，这种自闭环的验证到底有多可靠，文章也没展开。我会先打个折：思路有意思，但缺横向对比和任务清单，暂时只能当个自动化实验框架看。
