# 我们让 Grok 4.5、GPT-5.5 和 Claude 写同样的三个小应用，比速度和成本

> 原标题：We made Grok 4.5, GPT-5.5, and Claude build the same apps

- 来源：Hacker News 首页
- 发布时间：2026-07-08T23:27:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43196
- 原文：https://www.tryai.dev/blog/grok-4.5-vs-gpt-5.5-vs-claude-build-off

## 摘要

TryAI 给 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Fable 5 发了三个相同的编程任务：一个 3D 魔方、一个粒子重力沙盒、一个打砖块游戏，要求一次生成、不调提示词。Claude 两款模型在魔方上第一把就做对了，Grok 4.5 第一次只渲染出空白画面，用掉唯一一次重试机会后才成功，GPT-5.5 则只画出一个暗色...

## 推荐理由

TryAI 做了场编程实战，不是跑分，而是让几个模型一次生成三个应用，把翻车、重试、耗时和花费都摆出来。Claude 两款在魔方上第一把就过，Grok 4.5 第一次白屏、用掉唯一重试机会才成功，GPT-5.5 只画了个暗色画面——这些具体失败比榜单分数更有参考价值。我会先打个折：TryAI 不是一线评测机构，正文也只给了摘要，完整数据得点进去看，所以分数没给更高。

## 锐评

TryAI 的这次测试很实在，就是让四个模型各写三个小游戏，一次生成，不帮忙改提示词，然后看谁能跑通。结果最难的 3D 魔方直接拉开了差距：Claude Opus 4.8 和 Fable 5 一把就做出了能转能复原的彩色魔方，Grok 4.5 第一次只给了个空白页，用掉唯一一次重试机会才搞定，GPT-5.5 则只画出一个暗色面，基本算翻车。后面两个任务（粒子沙盒和打砖块）大家都做出来了，差别主要在视觉效果上。

速度方面，Grok 4.5 最快，首 token 延迟 0.44 秒，吞吐量约每秒 110 个 token，单次回复成本也最低。Fable 5 最慢也最贵。但文章没提模型参数量、训练细节，也没说测试时用的具体温度和采样参数，这些都会影响一次生成的成功率。另外，只给一次重试机会的规则对 Grok 4.5 这种首轮翻车但第二轮能跑通的模型来说，有点严苛，实际用的时候你肯定会多试几次。整体看，Claude 在复杂一次性代码生成上更稳，Grok 胜在便宜和快，GPT-5.5 这次表现低于预期。
