跳到正文
Hacker News 首页

12 个模型写 4 个同样的 App:GPT-5.6、Grok 4.5、Claude 和 Muse Spark 现场比试

GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps

TryAI 让 12 个模型各试 5 次,去写一个伪 3D 迷宫、一个魔方、一个计算器和一个生命游戏。GPT-5.6 Sol 最稳,迷宫 5 次全过,但每次跑要花 1.35 美元;Grok 4.5 也是 5 次全过,只要 0.27 美元,性价比很高。Meta 新出的 Muse Spark 1.1 有点抽风,5 次里坏了 3 次,但能跑的那两次质量跟 S...

推荐理由:TryAI 搞了场 12 个模型的编程实战,用四个小应用测通过率、成本和延迟,GPT-5.6 Sol 和 Grok 4.5 的性价比差距是最大看点。我会先打个折:这是第三方评测,不是官方发布,样本量也不大,所以分数没给太高。Muse Spark 1.1 表现抽风,拉低了一点整体信号的清晰度,但核心结论——Grok 4.5 在可靠性和价格上很能打——对选模型的人有直接参考价值。

读原文 ↗导出 Markdown