# 开源模型可能 2026 年 12 月追上闭源，但换个基准看差距纹丝不动

> 原标题：The gap between open weights LLMs and closed source LLMs

- 来源：Hacker News 首页
- 发布时间：2026-06-26T21:14:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40763
- 原文：https://blog.doubleword.ai/frontier-os-llm

## 摘要

Jamie Dborin 用 Artificial Analysis 的 18 个基准测了开源和闭源大模型之间的差距。只看他们主打的“智能指数”，差距一直在缩小，按趋势线外推，到 2026 年 12 月 3 号左右开源就能追平。但把 18 个基准全算上，平均差距几乎是一条直线，稳定在不到 5 个月。进步最大的是编程，从落后 15 个月缩到一两个月；其他...

## 推荐理由

Jamie Dborin 拿 Artificial Analysis 的 18 个基准测了开源和闭源大模型的差距，然后自己拆了自己的台。按他们主推的“智能指数”画趋势线，开源会在 2026 年 12 月 3 号左右追平闭源，这个日期很抓眼球。但把 18 个基准全算上，平均差距稳在不到 5 个月，几乎是一条直线，说明整体追得没那么快。进步最大的是编程，从落后 15 个月缩到一两个月，其他能力就没这么乐观。我会先打个折：单一指数外推变数太大，全基准那条平线反而更值得认真看。正文没披露这 18 个基准的具体权重和构成，所以“智能指数”到底有多代表综合能力...

## 锐评

Jamie Dborin 用 Artificial Analysis 的 18 个基准测了开源和闭源模型的差距。只看他们主打的“智能指数”，差距确实在缩小，按趋势线外推，到 2026 年 12 月 3 号左右开源就能追平。但把 18 个基准全算上，平均差距几乎是一条直线，稳定在不到 5 个月。进步最大的是编程，从落后 15 个月缩到一两个月；其他基准的差距反而在慢慢拉大。

这个对比暴露了一个老问题：用单一指标讲故事很容易，但模型能力是多维的。正文没披露具体模型版本，也没说这些基准有没有被训练数据污染。如果编程分数的提升有一部分来自数据泄露，那“追平”的含金量就得打折。另外，趋势线外推本身假设进步速度不变，这在 AI 领域不太靠谱。

我会先打个折看这个预测。开源模型在编程上确实追得快，但要说整体能力追平闭源，还缺更多维度的证据，尤其是推理、长上下文和安全性这些更难量化的地方。
