开源模型可能 2026 年 12 月追上闭源,但换个基准看差距纹丝不动
The gap between open weights LLMs and closed source LLMs
Jamie Dborin 用 Artificial Analysis 的 18 个基准测了开源和闭源大模型之间的差距。只看他们主打的“智能指数”,差距一直在缩小,按趋势线外推,到 2026 年 12 月 3 号左右开源就能追平。但把 18 个基准全算上,平均差距几乎是一条直线,稳定在不到 5 个月。进步最大的是编程,从落后 15 个月缩到一两个月;其他...
推荐理由:Jamie Dborin 拿 Artificial Analysis 的 18 个基准测了开源和闭源大模型的差距,然后自己拆了自己的台。按他们主推的“智能指数”画趋势线,开源会在 2026 年 12 月 3 号左右追平闭源,这个日期很抓眼球。但把 18 个基准全算上,平均差距稳在不到 5 个月,几乎是一条直线,说明整体追得没那么快。进步最大的是编程,从落后 15 个月缩到一两个月,其他能力就没这么乐观。我会先打个折:单一指数外推变数太大,全基准那条平线反而更值得认真看。正文没披露这 18 个基准的具体权重和构成,所以“智能指数”到底有多代表综合能力...