# 人大团队让AI跑了23小时、74轮实验，靠的不是堆Agent，而是把文件当总线用

> 原标题：Agent不是关键！人大AiScientist实现23小时、74轮长程记忆

- 来源：新智元 · 公众号
- 发布时间：2026-04-20T04:02:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/7023
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652693613&idx=3&sn=7fa2163604c338406d7beaefd751df54

## 摘要

人大高瓴人工智能学院放出了一个叫AiScientist的系统，在MLE-Bench Lite的一个侮辱性言论检测任务上连续跑了23小时、74轮实验，把验证集AUC从0.903拉到了0.982，中间刷新了18次最佳成绩。论文的核心观点是：长程记忆的关键不在多Agent协作，而在状态连续性。他们搞了个File-as-Bus机制，把分析、代码、日志、结果全持...

## 推荐理由

人大这个 AiScientist 跑了 23 小时、74 轮实验，把检测侮辱性评论任务的 AUC 从 0.903 干到 0.982。论文的核心卖点不是 Agent 数量，而是 File-as-Bus——让模型把分析、代码、日志、实验记录持续写回工作区，靠状态连续性而不是多 agent 协作来推进长程任务。消融实验也印证了这点：去掉这个机制后，PaperBench 分数降 6.41 分，MLE-Bench Lite 的 Any Medal 直接掉 31.82 个百分点。我会先打个折：只在两个 benchmark 上验证过，泛化性还没谱，但思路本身对正...

## 锐评

人大高瓴放出的AiScientist，在侮辱性言论检测任务上连续跑了23小时、74轮实验，验证集AUC从0.903提升到0.982，中间刷新了18次最佳成绩。论文的核心判断是：长程记忆的关键不在多Agent协作，而在状态连续性。他们搞了个File-as-Bus机制，把分析、代码、日志、结果全持久化在工作区里，让模型每次迭代都能接着上次的上下文继续干活。

这个思路本身不复杂，但消融实验的数字挺说明问题：去掉File-as-Bus后，PaperBench掉6.41分，MLE-Bench Lite Any Medal掉31.82分。也就是说，这个机制对系统持续产出能力的影响是实打实的。不过要注意，目前只在一个任务上验证了23小时的稳定性，跨任务、跨领域的泛化能力正文没披露。另外，74轮实验跑出0.982的AUC，任务本身的难度和天花板也需要更多信息才能判断这个提升到底有多大含金量。

还缺什么：多任务并行下的状态管理表现、更长时间跨度的稳定性测试、以及和其他Agent架构的横向对比数据。这些信息没出来之前，先别急着把这个方案当成通用解法。
