# 普林斯顿实测：给 AI 智能体几千美元和六天时间，它还是做不了开放式 AI 研究

> 原标题：AI智能体尚无法开展开放式AI研究

- 来源：AI HOT 精选
- 发布时间：2026-08-05T13:49:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48900
- 原文：https://www.normaltech.ai/p/ai-agents-cant-yet-do-open-ended

## 摘要

普林斯顿团队找了两个还没发表的 AI 论文课题，把研究问题丢给顶尖的 AI 智能体，给了几千美元的计算预算和六天时间，让它自己跑实验写论文。结果两篇论文都被原论文作者直接拒了。研究人员翻了一百多个小时的运行日志，发现智能体缺的不是算力，而是研究判断力：它提出了一些让专家都觉得不错的方向，但一看到低质量或合成数据就马上放弃；预算连一半都没花完，时间也没用...

## 推荐理由

普林斯顿团队给顶尖 AI 智能体出了两道还没发表的论文题，给了几千美元计算预算和六天时间，让它自己设计实验、跑代码、写论文。结果两篇都被原论文作者直接拒了。研究人员翻了一百多小时的运行日志发现，智能体不是算力不够，而是研究判断力跟不上：它能提出让专家都觉得不错的方向，但一碰到低质量或合成数据就马上放弃，预算连一半都没花完，时间也没用完。这个实验用受控条件把智能体的短板暴露得很清楚——它缺的不是资源，是坚持和辨别力。

## 锐评

这个实验挺狠的，直接拿还没发表的论文当考题，让AI智能体自己跑实验写论文，最后让原论文作者来打分。结果两篇都被拒了，说明现在最前沿的AI智能体离独立做开放式研究还差得远。

研究人员翻了一百多个小时的运行日志，发现智能体的问题不是算力不够，而是不会做研究。它提出过一些让专家都觉得不错的方向，但一看到低质量或合成数据就马上放弃，连试都不愿意多试。预算给了几千美元，它连一半都没花完，时间也没用完，就像考试提前交卷但答案全错。更麻烦的是，它自己的AI审稿工具已经指出了很多问题，但智能体收到负面反馈后只是给结论加一堆限定词，而不是换个思路。

这个实验的局限在于只测了两个课题，而且用的是特定几个前沿模型，正文没披露具体是哪些模型。另外，六天的时间和几千美元的预算对真实研究来说还是太短太少了，可能低估了智能体在更长周期里的表现。但至少说明，现在那些声称AI能自动搞科研的说法，水分很大。
