# JuliaHub 实测 GPT-5.6 和 Claude Fable 5 做物理仿真：Fable 5 分最高但贵 3 到 8 倍

> 原标题：GPT-5.6 vs. Claude Fable 5 for Physical AI, which performs best?

- 来源：Hacker News 首页
- 发布时间：2026-07-29T14:56:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47417
- 原文：https://juliahub.com/blog/frontier-models-physical-ai-evaluation

## 摘要

JuliaHub 把 GPT-5.6 的三个版本（terra、sol、luna）和 Claude Fable 5 关进同一个叫 Dyad 的智能体框架里，让它们去解五道密封的物理建模题，最后只看仿真轨迹跟真实答案的吻合度，不看代码。Fable 5 加权得分 0.889 排第一，但跑一次平均要 9.6 美元，是 GPT-5.6 系列的 3 到 8 倍。G...

## 推荐理由

JuliaHub 用自建的 Dyad 框架跑了一次密封物理建模基准，把 GPT-5.6 三个版本和 Claude Fable 5 放在一起比轨迹吻合度。Fable 5 精度最高但成本也最贵，luna 性价比突出。不标 featured 是因为这只是单一评测方的结果，不是官方模型发布，而且只有五道题，样本太小，结论需要打折看。

## 锐评

JuliaHub 把 GPT-5.6 三个版本和 Claude Fable 5 塞进同一个叫 Dyad 的智能体框架，让它们解五道密封的物理建模题，最后只看仿真轨迹跟真实答案的吻合度，不看代码。Fable 5 加权得分 0.889 排第一，但成本高得离谱——跑一次平均 9.6 美元，整个测试烧了 125 美元，是 GPT-5.6 系列的 3 到 8 倍。GPT-5.6 Sol 得分 0.814，一次只要 1.74 美元，性价比明显更好。

所有模型在前四道题上表现都不错，但在最难的长周期飞行器 HL-20 上集体翻车，Fable 5 也只拿到 0.69。这说明模型在需要多步推理、细节容易出错的工程问题上还不太稳。测试设计本身比较靠谱：题目密封、只看轨迹吻合度、不信任模型自己写的测试，避免了“自己出题自己答”的作弊空间。

正文没解释为什么 Luna 最慢也最贵，也没说这五道题能不能代表真实工程场景的多样性。另外，只跑了 52 次试验，样本量偏小，分数波动可能比较大，排名别太当真。
