热点事件历史事件
Token 便宜到不值得计费了
1 篇报道1 个报道来源6 天前更新
先了解这件事
事实说明
作者 jyn 用多张图表说明,AI 推理成本每年都在以数量级的速度下降。GPU 能效大约每两年翻一番,到 2026 年,完成同样任务的模型成本比 2025 年底便宜了两个数量级。像 vLLM 这样的推理引擎,每年还能额外带来 10% 到 50% 的吞吐量提升。文章判断,一两年内大模型会像水电一样成为计算基础设施,三到六年内,消费级硬件就能在本地跑通当前...
报道时间线
沿着报道,了解事件的不同侧面。
9月23日
- Hacker News 首页精选Token 便宜到不值得计费了
作者 jyn 用多张图表说明,AI 推理成本每年都在以数量级的速度下降。GPU 能效大约每两年翻一番,到 2026 年,完成同样任务的模型成本比 2025 年底便宜了两个数量级。像 vLLM 这样的推理引擎,每年还能额外带来 10% 到 50% 的吞吐量提升。文章判断,一两年内大模型会像水电一样成为计算基础设施,三到六年内,消费级硬件就能在本地跑通当前...