开源模型自己部署,推理成本能砍到闭源模型的五分之一
The Economics of Open-Weight Inference
Ornn Data 这份报告算了一笔账:自己租 GPU 跑开源模型,生成每百万 token 的成本可以压到 0.12 到 0.35 美元,差不多是调用闭源模型价格的五分之一。有意思的是,在跑 gpt-oss-120b 这种稀疏模型(实际干活只用 51 亿参数)时,老款 A100 反而比 H100 更省钱,满负荷下每百万 token 只要 0.12 美元...
The Economics of Open-Weight Inference
Ornn Data 这份报告算了一笔账:自己租 GPU 跑开源模型,生成每百万 token 的成本可以压到 0.12 到 0.35 美元,差不多是调用闭源模型价格的五分之一。有意思的是,在跑 gpt-oss-120b 这种稀疏模型(实际干活只用 51 亿参数)时,老款 A100 反而比 H100 更省钱,满负荷下每百万 token 只要 0.12 美元...