同一套编排骨架,换 GPT-4o 只多 5.8 分,训练 7B 决策节点却多出 17.2 分
换 GPT-4o 只多 5.8 分,训练 7B 却多了 17.2 分
Stanford 的 AgentFlow 论文做了一个很直接的对比:在同一个 agent 工作流里,把负责规划和调工具的决策节点从 Qwen2.5-7B 换成 GPT-4o,六个基准测试平均只涨了 5.8 分。但让这个 7B 节点在真实运行环境里,根据工具返回的成败信号边跑边学,平均涨了 17.2 分。差距不在模型大小,在于一个能持续吸收反馈,另一个停...
推荐理由:我会先打个折:正文没披露训练成本和延迟数据,所以 17.2 分的提升能不能直接搬到生产环境还得看具体实现。但 Stanford 这篇 AgentFlow 论文的对比很直接——在同一个 agent 工作流里,把决策节点从 Qwen2.5-7B 换成 GPT-4o,六个基准平均只涨 5.8 分;让这个 7B 节点根据工具返回的成败信号边跑边学,平均涨了 17.2 分。差距不在模型大小,在于一个能持续吸收反馈,另一个停在那里。对正在搭 agent 的人来说,这比无脑上大模型省钱,也给出了一个可复现的训练思路。