跳到正文
AI HOT 精选

开源模型井喷:Gemma 4、DeepSeek V4、Kimi K2.6 等集体发布,CAISI 评估称开源落后闭源

最新开源成果(#21):开源模型盛宴!Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1 等。基于CAISI的V4评估。

这个月开源模型扎堆更新,DeepSeek V4、Gemma 4、Kimi K2.6、MiMo 2.5、GLM-5.1 全来了。CAISI(美国 AI 标准与创新中心)用 9 个基准测了 DeepSeek V4,给出的结论是开源模型跟美国闭源前沿差距在拉大,尤其在 CTF 安全挑战、ARC-AGI-2 和他们的私密基准 PortBench 上 V4 得分...

推荐理由:这条消息把五款开源模型的新版本打包在一起,还挂了个 CAISI V4 评估的钩子,对关注模型选型的人挺有吸引力。我会先打个折:正文只说用了这套框架测试,分数一个没给,所以目前只能当个发布清单看,没法横向比较。这点先别太激动。不过模型名字和版本号都明确,开源阵营的密集更新本身就能影响团队的部署和成本判断,所以整体还是值得推。

读原文 ↗导出 Markdown