# 智能性价比

- 来源：AI HOT 精选
- 发布时间：2026-06-03T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33609
- 原文：https://www.tomtunguz.com/tokens-per-result

## 摘要

微软在模型发布卡里加了个新指标：平均 token 用量。他们的新模型在 SWE-Bench Verified 上拿了 71.6 分，但消耗的 token 只有 Claude Haiku 4.5 的三分之一。这意味着现在衡量模型得看两个维度：活儿干得怎么样，以及干这活儿花了多少钱。靠烧 token 刷榜、靠补贴打价格战的时代在翻篇。Uber 四个月烧光预...

## 推荐理由

H、K、R 三条都站得住。用“跑分除以 token 消耗”当钩子，比单纯报分数更让人想点进去看。71.6 分和三分之一的 token 量是实打实的新信息。不过文章没给出完整的测试配置和具体定价对比，所以重要性停在 78 分，我会先打个折，不往更高拉了。

## 锐评

微软给新模型 MAI-Code-1-Flash 的发布卡里加了个新指标：平均 token 用量。这个模型在 SWE-Bench Verified 上拿了 71.6 分，但消耗的 token 只有 Claude Haiku 4.5 的三分之一。这意味着衡量模型得同时看两个维度：活儿干得怎么样，以及干这活儿花了多少钱。靠烧 token 刷榜、靠补贴打价格战的路子走不通了。

文章举了几个例子说明大公司也扛不住成本：Uber 四个月就烧光了员工 AI 预算，被迫设了上限；Salesforce 花了 3 亿美元买 Anthropic 的 token，同时冻结了工程师招聘。Artificial Analysis 的数据更直观：GPT 5.5 和 Claude Opus 4.8 在智能指数上只差 1 分，但跑完测试的成本差了 40%。

文章判断，模型公司以后得在性能和成本两条线上竞争，而应用层会更进一步，按“每个结果花多少钱”来定价。正文没披露微软这个新模型的具体定价，也没说平均 token 用量是在什么任务条件下测的，这点先别太激动。
