# 学生盲测 6851 票：写大学论文，Gemini 赢了 Claude 和 ChatGPT

> 原标题：Students prefer Gemini over ChatGPT and Claude for AI essays in blind tests

- 来源：Hacker News 首页
- 发布时间：2026-08-26T03:23:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52869
- 原文：https://studyarena.com/blog/chatgpt-vs-claude-vs-gemini-college-essays-2026

## 摘要

StudyArena 让学生盲选 AI 写的论文，不看模型名字只看内容。Gemini 拿了 39.6% 的票，Claude 31.8%，ChatGPT 29.2%。学生明显偏爱更长的回答，胜出的回答平均比输家长 37%。一个反直觉的发现是，开高推理模式反而会降低写作得票率，低推理设置赢了 40.7%，高推理只赢了 29.5%，因为想太多会让文章变得啰嗦...

## 推荐理由

这篇是 StudyArena 自己发的产品博客，不是第三方基准测试，我会先打个折。但 6,851 次盲投的数据量不算小，结论也够反直觉：学生就是喜欢更长的回答，胜出回答平均比输家长 37%；开高推理模式反而让文章变啰嗦、得票更低。对做 AI 写作产品的人是个挺具体的信号——用户要的不是“想太多”的文本，而是读起来顺畅、篇幅够的内容。正文没披露学生来自哪些学校、论文题目是什么，这点先别太激动。

## 锐评

StudyArena 让 6,851 名学生盲选 AI 写的论文，Gemini 拿了 39.6% 的票，Claude 31.8%，ChatGPT 29.2%。学生明显偏爱更长的回答，胜出的回答平均比输家长 37%。一个反直觉的发现是，开高推理模式反而会降低写作得票率，低推理设置赢了 40.7%，高推理只赢了 29.5%，因为想太多会让文章变得啰嗦。

这个结果得打个折。正文没披露用了什么提示词，也没说评分标准是什么。如果只是让学生凭感觉选，那这个测试测的其实是“哪家 AI 更会堆字数”，而不是“哪家 AI 写得更好”。学生觉得长就是好，这本身就是一个值得注意的偏差。

还缺关键信息：论文题目是什么？是议论文、个人陈述还是研究综述？不同文体对模型的要求完全不同。另外，6,851 票是来自多少人？如果少数人反复投票，样本的代表性也要打问号。
