# 按 token 标价不靠谱，看单任务成本才知道模型贵不贵

> 原标题：Price per 1M tokens is meaningless

- 来源：Hacker News 首页
- 发布时间：2026-07-06T19:43:36.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42762
- 原文：https://janilowski.pl/en/blog/2026/price-per-m-tokens/

## 摘要

Jan Iłowski 用 Artificial Analysis 的跑分数据算了一笔账：GPT-5.5 xhigh 虽然标价看着高，但完成一个任务只要 0.99 美元，比 Claude Opus 4.8 max 的 1.78 美元便宜近一半。原因有两个：一是各家模型切分文本的“分词器”不一样，Anthropic 最近改了一次，同样文本多切出 30% ...

## 推荐理由

有具体跑分数据和成本对比，不是空谈观点；分词器改动带来的 30% 隐性涨价对从业者很实用。扣分是因为这是个人博客，不是官方发布，而且只给了开头，完整论证力度未知。

## 锐评

Jan Iłowski 这篇博客的核心判断很直接：盯着“每百万 token 单价”选模型，大概率会花更多钱拿到更差的结果。他用 Artificial Analysis 的跑分数据做了个对比表，把各家模型的标价和实际完成一个基准任务的成本放在一起。GPT-5.5 xhigh 输入/输出标价是 5/30 美元，Claude Opus 4.8 max 是 5/25 美元，单看数字 Opus 更便宜。但跑完同一个基准，GPT-5.5 花了 0.99 美元，Opus 花了 1.78 美元，贵了将近一倍。原因有两个：一是各家切分文本的“分词器”不一样，Anthropic 最近改了一次，同样文本多切出 30% 的 token，相当于变相涨价；二是模型“思考”时产生的隐藏 token 也被按同样价格计费，而这部分消耗在不同模型之间差异极大，才是真正吃掉预算的大头。

表格里还有几个值得注意的点。DeepSeek V4 Pro max 标价极低，跑一个任务只要四五美分，但基准得分只有 44，明显低于头部模型。GLM-5.2 标价是 GPT 的三分之一到六分之一，但实际任务成本并没有同比例下降，说明它的 token 利用效率不如西方模型。最贵的是 Claude Fable 5，一个任务要 3.25 美元，得分最高 60，但比 GPT-5.5 贵了三倍多，提升幅度有限。

这篇分析的局限在于只引用了 Artificial Analysis 一个基准的数据，不同任务场景下模型的表现和成本结构可能完全不同。正文也没披露各家模型在基准测试中具体消耗了多少隐藏推理 token，这部分数据如果能拿到，判断会更扎实。另外，Sonnet 5 max 的数据有点反常——得分比 Opus 低，任务成本反而更高，作者自己也表示困惑，这点先别急着下结论。
