# Fireworks 提出“Agent 执行税”：浏览器智能体跑任务时，22.9% 的推理算力都浪费了

> 原标题：Agent Execution Tax: new procurement metric for browser agent benchmarks?

- 来源：r/LocalLLaMA
- 发布时间：2026-05-21T15:07:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25354
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tjnd5m/agent_execution_tax_new_procurement_metric_for/

## 摘要

Fireworks 在 WebVoyager 上跑了 720 个浏览器智能体任务，发现平均有 22.9% 的推理调用属于无效消耗，他们管这个叫“Agent 执行税”——也就是为了完成任务，模型多做的无用功。具体到各家模型：MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍；GLM-5 的任务成功率做到 57.1%；Ki...

## 推荐理由

HKR 三项都站得住：它把一个跑分现象包装成了可复用的采购指标，有具体数字支撑，而且直接回应了从业者在选型时对隐性成本的焦虑。信源是 Fireworks 自己的博客和 Reddit 讨论，不是第三方独立评测，所以重要性停在 74 分 featured 档，没往上拉。

## 锐评

这条信息值得点开看，因为它把智能体评测从“能不能跑通”推进到了“跑通花了多少冤枉钱”。Fireworks 在 WebVoyager 上跑了 720 个任务，发现平均 22.9% 的推理调用属于无效消耗，他们管这个叫“Agent 执行税”。这个指标比单纯看任务成功率更贴近实际采购决策：你不仅要看模型能不能完成任务，还得看它为了完成任务多做了多少无用功。

具体数字方面，MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍，GLM-5 的任务成功率做到 57.1%，Kimi K2.5 在 852 次调用里解析重试率为零。这些数字说明不同模型在“执行效率”上差距很大，但正文没披露测试环境的具体配置、任务难度分布，也没说这个 22.9% 的无效调用是怎么定义和计算的。

还缺一个关键信息：这个“执行税”在不同类型的任务上是不是稳定的。如果只在简单任务上低、复杂任务上飙升，那采购时就不能只看一个平均数。另外，成本对比只提了 Gemini 作为参照，没给其他主流模型的横向数据，这点先别太激动。
