# 同一套编排骨架，换 GPT-4o 只多 5.8 分，训练 7B 决策节点却多出 17.2 分

> 原标题：换 GPT-4o 只多 5.8 分，训练 7B 却多了 17.2 分

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-04T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54940
- 原文：https://yage.ai/share/agentflow-trainable-decision-node-20260904.html

## 摘要

Stanford 的 AgentFlow 论文做了一个很直接的对比：在同一个 agent 工作流里，把负责规划和调工具的决策节点从 Qwen2.5-7B 换成 GPT-4o，六个基准测试平均只涨了 5.8 分。但让这个 7B 节点在真实运行环境里，根据工具返回的成败信号边跑边学，平均涨了 17.2 分。差距不在模型大小，在于一个能持续吸收反馈，另一个停...

## 推荐理由

我会先打个折：正文没披露训练成本和延迟数据，所以 17.2 分的提升能不能直接搬到生产环境还得看具体实现。但 Stanford 这篇 AgentFlow 论文的对比很直接——在同一个 agent 工作流里，把决策节点从 Qwen2.5-7B 换成 GPT-4o，六个基准平均只涨 5.8 分；让这个 7B 节点根据工具返回的成败信号边跑边学，平均涨了 17.2 分。差距不在模型大小，在于一个能持续吸收反馈，另一个停在那里。对正在搭 agent 的人来说，这比无脑上大模型省钱，也给出了一个可复现的训练思路。

## 锐评

这篇论文给 agent 开发者提了个醒：过去我们默认模型是焊死的，所有优化都在外面绕，现在开放权重模型让工作流里的决策节点也能训练了。核心实验很直接，同一个系统骨架，三种改法三种结果。换 GPT-4o 只涨 5.8 分，说明更强的通用模型并不会天然适配你的特定工作流。照抄 GPT-4o 的成功轨迹做监督微调反而暴跌 19 分，因为 agent 的每一步都建立在上一步引发的新状态上，直接模仿别人的动作序列，模型没学会处理属于自己的意外。真正拉开差距的是在线训练，让模型在真实环境里根据工具返回的成败信号自己调整，工具调用错误率最高降了 28.4%，模型甚至自己学会了遇到医学问题优先查维基百科而不是谷歌。

但别急着上。文章列了四道硬门槛：任务得高频发生，成败能自动判定，错误瓶颈真在决策逻辑而不是检索或 API，环境能安全重置。过不了这四道门，训练就是白花钱。成本方面，论文只说了 8 张 A100，没给总时长和 GPT-4o 裁判的账单，自建训练体系省下的 token 差价能不能覆盖全生命周期开销，目前还是笔糊涂账。起步门槛倒比预想低，社区有人用单张 A100 甚至 RTX 4090 就跑通了小规模训练，但前提依然是四道门先过。
