# 开源模型井喷：Gemma 4、DeepSeek V4、Kimi K2.6 等集体发布，CAISI 评估称开源落后闭源

> 原标题：最新开源成果（#21）：开源模型盛宴！Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1 等。基于CAISI的V4评估。

- 来源：AI HOT 精选
- 发布时间：2026-05-16T17:00:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21744
- 原文：https://www.interconnects.ai/p/latest-open-artifacts-21-open-model

## 摘要

这个月开源模型扎堆更新，DeepSeek V4、Gemma 4、Kimi K2.6、MiMo 2.5、GLM-5.1 全来了。CAISI（美国 AI 标准与创新中心）用 9 个基准测了 DeepSeek V4，给出的结论是开源模型跟美国闭源前沿差距在拉大，尤其在 CTF 安全挑战、ARC-AGI-2 和他们的私密基准 PortBench 上 V4 得分...

## 推荐理由

这条消息把五款开源模型的新版本打包在一起，还挂了个 CAISI V4 评估的钩子，对关注模型选型的人挺有吸引力。我会先打个折：正文只说用了这套框架测试，分数一个没给，所以目前只能当个发布清单看，没法横向比较。这点先别太激动。不过模型名字和版本号都明确，开源阵营的密集更新本身就能影响团队的部署和成本判断，所以整体还是值得推。

## 锐评

这个月开源模型扎堆发版，但最值得聊的不是模型本身，而是 CAISI 对 DeepSeek V4 的评估方式。CAISI 用 9 个基准算出 Elo 分，结论是开源跟美国闭源前沿差距在拉大。但仔细看，V4 的 Elo 被三个基准拖了后腿：CTF-Archive-Diamond 安全挑战、CAISI 自己的私密基准 PortBench，以及 ARC-AGI-2。其中 CTF 只跑了部分题目然后用统计方法外推，ARC-AGI-2 的评分方式也跟公开榜单不一样。这几个基准的权重把整体分差放大了。

作为对比，Epoch AI 的 ECI 指数同样用统计方法跨基准比较，显示差距大概在 3 到 7 个月，没有 CAISI 画的那么夸张。文章作者也承认两边都不完整——这些评估都用的是标准化、简化的测试环境，比如编程题只给一个 for 循环和固定 token 预算，而不是模型实际训练时用的 Claude Code 或 OpenCode 这类工具链。这就好比用自动挡考试的成绩去判断一个赛车手的水平。

正文没披露 V4 在各项基准上的原始得分，也没说 PortBench 具体测什么。要判断差距到底多大，还得看用模型原生工具链跑出来的结果。
