Jan Iłowski 这篇博客的核心判断很直接:盯着“每百万 token 单价”选模型,大概率会花更多钱拿到更差的结果。他用 Artificial Analysis 的跑分数据做了个对比表,把各家模型的标价和实际完成一个基准任务的成本放在一起。GPT-5.5 xhigh 输入/输出标价是 5/30 美元,Claude Opus 4.8 max 是 5/25 美元,单看数字 Opus 更便宜。但跑完同一个基准,GPT-5.5 花了 0.99 美元,Opus 花了 1.78 美元,贵了将近一倍。原因有两个:一是各家切分文本的“分词器”不一样,Anthropic 最近改了一次,同样文本多切出 30% 的 token,相当于变相涨价;二是模型“思考”时产生的隐藏 token 也被按同样价格计费,而这部分消耗在不同模型之间差异极大,才是真正吃掉预算的大头。
表格里还有几个值得注意的点。DeepSeek V4 Pro max 标价极低,跑一个任务只要四五美分,但基准得分只有 44,明显低于头部模型。GLM-5.2 标价是 GPT 的三分之一到六分之一,但实际任务成本并没有同比例下降,说明它的 token 利用效率不如西方模型。最贵的是 Claude Fable 5,一个任务要 3.25 美元,得分最高 60,但比 GPT-5.5 贵了三倍多,提升幅度有限。
这篇分析的局限在于只引用了 Artificial Analysis 一个基准的数据,不同任务场景下模型的表现和成本结构可能完全不同。正文也没披露各家模型在基准测试中具体消耗了多少隐藏推理 token,这部分数据如果能拿到,判断会更扎实。另外,Sonnet 5 max 的数据有点反常——得分比 Opus 低,任务成本反而更高,作者自己也表示困惑,这点先别急着下结论。