# 用一句话复刻《我的世界》不叫评测，这叫表演赛

> 原标题：Recreating Minecraft Is Not a Benchmark

- 来源：Hacker News 首页
- 发布时间：2026-09-06T14:52:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55128
- 原文：https://kuber.studio/blog/Reflections/Recreating-Minecraft-is-Not-a-Benchmark

## 摘要

GPT Astra 一发布，社交时间线上全是同一类演示：一句提示词生成一个《我的世界》克隆版、用画图板画自己、画骑自行车的鹈鹕 SVG。这些 demo 看着唬人、谁都能看懂，但作者 Kuber Mehta 管它们叫“演示基准”——问题太固定，实验室完全可以在下一版模型里专门针对这几个花样做优化，刷到满分。所以这类测试已经测不出模型真实能力了，只能说明厂...

## 推荐理由

一篇观点文，但给出了一个能直接用的判断框架（“演示基准”），对看腻了《我的世界》克隆演示的从业者来说挺实用。分数没给更高是因为缺实验数据，属于经验观察而非实证研究。

## 锐评

Kuber Mehta 把 GPT Astra 发布后刷屏的“一句提示词生成《我的世界》克隆版”这类演示叫做“演示基准”。问题在于，这些任务太固定了，实验室完全可以在下一版模型里专门针对这几个花样做优化，刷到满分。所以这类测试已经测不出模型真实能力，只能说明厂商很会做营销 demo。

文章没有给出替代方案，也没提供任何量化数据来证明“针对性优化”到底有多容易。但逻辑本身站得住：如果一个测试的题目池很小、答案可预期，那它就不是在测通用能力，而是在测背诵。

还缺什么？缺一个真正能区分“背题”和“理解”的评测框架。另外，正文没披露 GPT Astra 在这些 demo 上的具体成功率或失败案例，所以“刷分”的判断目前还只是合理推测，不是实锤。
