# Fable 5 对战 GPT-5.6 Sol：/goal 命令到底有没有用？

> 原标题：Fable 5 vs. GPT-5.6 Sol on an NP-Hard Problem: Does /goal help?

- 来源：Hacker News 首页
- 发布时间：2026-07-18T11:00:29.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45099
- 原文：https://charlesazam.com/blog/fable-5-gpt-5-6-sol-goal/

## 摘要

作者拿一个未公开的 NP-hard 光纤网络优化问题，让 Claude Fable 5 和 GPT-5.6 Sol 各跑了三轮 30 分钟测试，对比普通模式和 /goal 模式。Fable 5 的普通模式平均得分 32,386，比 Sol 的 34,261 低了 1,875 分（分数越低越好），而且三次普通跑分只差了 319 分，稳得离谱。/goal ...

## 推荐理由

作者自己动手跑了一个未公开的光纤网络优化问题，三轮 30 分钟测试，数字摆得很清楚。Fable 5 普通模式稳得离谱但分数略输 Sol，开了 /goal 反而崩了，这个反直觉的点是全文最有价值的地方。扣一点分是因为问题领域窄，且来源是个人博客而非官方发布，但实验设计和结论对从业者有参考意义。

## 锐评

这篇博客最值得看的是 Fable 5 的稳定性，而不是 /goal 模式。作者拿一个未公开的光纤网络优化问题做测试，搜索空间下限高达 10^1223，属于典型的 NP-hard 问题。Fable 5 在普通模式下三次 30 分钟跑分只差了 319 分，平均得分 32,386，比 GPT-5.6 Sol 的 34,261 低了近两千分（分数越低越好）。这种一致性在模型评测里很少见，说明 Fable 5 在这个任务上不是靠运气蒙对的。

/goal 模式的表现反而让人犹豫。它在六次对比中赢了四次，但两个模型的平均分都被拉低了——Fable 5 差了 759 分，Sol 差了 868 分。作者解释了两家 /goal 的底层差异：Claude Code 用 Haiku 做纯文本评估器，Codex 则有持久化状态和生命周期工具。这意味着 /goal 不是简单的"再想想"，它改变了搜索路径，有时找到更好的解，有时只是给一个烂方向更多时间发酵。

文章的限制也很明确：只测了一个问题、一种预算（30 分钟）、未公开数据集，所以结论不能直接推广。正文没披露这个问题的具体约束条件和最优解参考值，也没说明人类基准线到底是多少分。如果你关心的是模型在复杂优化任务上的原始推理能力，Fable 5 的表现值得关注；如果你在考虑把 /goal 当日常开关，这篇数据建议你先别急。
