跳到正文
r/LocalLLaMA

Fireworks 提出“Agent 执行税”:浏览器智能体跑任务时,22.9% 的推理算力都浪费了

Agent Execution Tax: new procurement metric for browser agent benchmarks?

Fireworks 在 WebVoyager 上跑了 720 个浏览器智能体任务,发现平均有 22.9% 的推理调用属于无效消耗,他们管这个叫“Agent 执行税”——也就是为了完成任务,模型多做的无用功。具体到各家模型:MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍;GLM-5 的任务成功率做到 57.1%;Ki...

推荐理由:HKR 三项都站得住:它把一个跑分现象包装成了可复用的采购指标,有具体数字支撑,而且直接回应了从业者在选型时对隐性成本的焦虑。信源是 Fireworks 自己的博客和 Reddit 讨论,不是第三方独立评测,所以重要性停在 74 分 featured 档,没往上拉。

读原文 ↗导出 Markdown