# 12 个模型写 4 个同样的 App：GPT-5.6、Grok 4.5、Claude 和 Muse Spark 现场比试

> 原标题：GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps

- 来源：Hacker News 首页
- 发布时间：2026-07-10T20:52:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43631
- 原文：https://www.tryai.dev/blog/gpt-5.6-build-off-12-models

## 摘要

TryAI 让 12 个模型各试 5 次，去写一个伪 3D 迷宫、一个魔方、一个计算器和一个生命游戏。GPT-5.6 Sol 最稳，迷宫 5 次全过，但每次跑要花 1.35 美元；Grok 4.5 也是 5 次全过，只要 0.27 美元，性价比很高。Meta 新出的 Muse Spark 1.1 有点抽风，5 次里坏了 3 次，但能跑的那两次质量跟 S...

## 推荐理由

TryAI 搞了场 12 个模型的编程实战，用四个小应用测通过率、成本和延迟，GPT-5.6 Sol 和 Grok 4.5 的性价比差距是最大看点。我会先打个折：这是第三方评测，不是官方发布，样本量也不大，所以分数没给太高。Muse Spark 1.1 表现抽风，拉低了一点整体信号的清晰度，但核心结论——Grok 4.5 在可靠性和价格上很能打——对选模型的人有直接参考价值。

## 锐评

TryAI 这次让 12 个模型各跑 5 次去写四个小应用，把随机性摊开来看，比单次跑分更有参考价值。GPT-5.6 Sol 在迷宫任务上 5 次全过，稳定性确实强，但代价是每次生成要花 1.35 美元，比 Grok 4.5 贵了整整五倍，而 Grok 同样做到 5 次全过。这说明如果你不是非要 Sol 那种极致一致性，Grok 4.5 是当前更划算的选择。

Meta 新出的 Muse Spark 1.1 表现不太稳定，迷宫任务 5 次里坏了 3 次，正文说能跑的那两次质量跟 Sol 差不多，但这么高的失败率在实际开发里会很耽误事。另外，这次测试只覆盖了前端小应用的生成，没涉及复杂后端逻辑或多文件项目，所以结论主要适用于这类单文件代码生成场景。所有原始构建和视频都公开了，你可以自己点开看每次尝试到底差在哪。
