JuliaHub 实测 GPT-5.6 和 Claude Fable 5 做物理仿真:Fable 5 分最高但贵 3 到 8 倍
JuliaHub 把 GPT-5.6 的三个版本(terra、sol、luna)和 Claude Fable 5 关进同一个叫 Dyad 的智能体框架里,让它们去解五道密封的物理建模题,最后只看仿真轨迹跟真实答案的吻合度,不看代码。Fable 5 加权得分 0.889 排第一,但跑一次平均要 9.6 美元,是 GPT-5.6 系列的 3 到 8 倍。G...
推荐理由:JuliaHub 用自建的 Dyad 框架跑了一次密封物理建模基准,把 GPT-5.6 三个版本和 Claude Fable 5 放在一起比轨迹吻合度。Fable 5 精度最高但成本也最贵,luna 性价比突出。不标 featured 是因为这只是单一评测方的结果,不是官方模型发布,而且只有五道题,样本太小,结论需要打折看。