# 11 个模型比赛重构一个 1500 行的 LangGraph 巨型节点，Fable 的方案拿了第一

> 原标题：Comparing Fable and 10 other LLMs on refactoring a LangGraph god node

- 来源：Hacker News 首页
- 发布时间：2026-07-02T13:19:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41950
- 原文：https://wtf.korridzy.com/twilight-of-the-gods/

## 摘要

作者把一个 1500 行的 LangGraph 巨型节点（god node，所有逻辑塞在一个函数里）扔给 11 个模型，让它们各自出重构方案和完整代码，然后让模型互相打分。Fable-5 的方案在同行评审里排第一，GPT-5.5 和 DeepSeek-4-pro 紧随其后，GPT-5.4 和 Opus-4.7 垫底。每个模型都产出了架构文档和代码，评审...

## 推荐理由

一篇 11 模型重构实战，有完整代码和同行互评排名，不是纸上谈兵。Fable-5 拿第一本身就值得讨论。扣分是因为这只是个人单次实验，不是受控基准测试，所以停在 feature 级别。

## 锐评

作者把 11 个模型扔进同一个坑：拆一个 1500 行的 LangGraph 巨型节点（所有逻辑塞在一个函数里，俗称 god node），让它们各自出重构方案和完整代码，再让模型互相打分。Fable-5 的方案在同行评审里排第一，GPT-5.5 和 DeepSeek-4-pro 紧随其后，GPT-5.4 和 Opus-4.7 垫底。

这个结果有意思，但得打几个折。首先，这只是一次重构任务，不是通用编程基准，换个代码库或语言排名可能就变了。其次，评审也是模型做的，模型互评的偏好本身就有偏差——比如它们可能更喜欢结构清晰、注释多的方案，而不是真正好维护的代码。作者公开了原始数据和排名矩阵，这点值得肯定，但正文没披露评审标准的具体权重，也没说有没有控制模型输出长度对评分的影响。

如果你日常在用 LangGraph 搭 agent 工作流，Fable-5 和 GPT-5.5 的方案值得翻出来看看，它们对怎么拆节点、怎么管状态有比较成熟的工程直觉。但别拿这个排名当采购清单，缺的东西还很多：没有长期维护成本的评估，没有多轮迭代重构的测试，也没有人类工程师的盲审对照。
