Token 便宜到不值得计费了
Tokens Too Cheap to Meter
作者 jyn 用多张图表说明,AI 推理成本每年都在以数量级的速度下降。GPU 能效大约每两年翻一番,到 2026 年,完成同样任务的模型成本比 2025 年底便宜了两个数量级。像 vLLM 这样的推理引擎,每年还能额外带来 10% 到 50% 的吞吐量提升。文章判断,一两年内大模型会像水电一样成为计算基础设施,三到六年内,消费级硬件就能在本地跑通当前...
推荐理由:这篇不是泛泛说“AI 越来越便宜”,而是用三条下降曲线把账算出来了:GPU 能效翻番周期、推理引擎的优化红利、以及本地部署的时间窗口。数据来源和图表都有,判断有依据。扣分点在于这是个人博客,不是机构报告,但观点和论证密度够高,对正在算推理成本的人有直接参考价值。