# Kimi K3 在漏洞利用测试中大幅落后美国前沿模型，知识蒸馏嫌疑或能解释差距

> 原标题：Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型，知识蒸馏或为原因

- 来源：AI HOT 精选
- 发布时间：2026-07-24T09:48:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46333
- 原文：https://the-decoder.com/kimi-k3-trails-frontier-us-models-by-a-wide-margin-on-cyber-exploits-and-distillation-may-explain-why

## 摘要

英国 AI 安全研究所和美国 CAISI 联合测试了月之暗面的 Kimi K3。在漏洞利用基准 ExploitBench 上，K3 得分 32.2%，而美国头部模型平均 76.2%，且 K3 在 41 个任务中一次都没能实现最高危的“任意代码执行”，美国模型则成功了 20 次。在模拟企业网络攻击的 TLO 测试里，K3 平均只能走完 32 步攻击路径中...

## 推荐理由

44 个百分点的漏洞利用差距和零次最高危执行，是这篇最扎眼的事实，够得上 featured。知识蒸馏的归因让讨论不止于“输了”，而是“为什么输”，对从业者有信息量。扣分是因为来源单一，且关键细节在付费墙后面，没法交叉验证，所以重要性停在 78。

## 锐评

英国和美国的 AI 安全机构联手测了月之暗面的 Kimi K3，结果不太好看。在 ExploitBench 这个专门测漏洞利用能力的基准上，K3 得分 32.2%，而美国头部模型平均 76.2%。更关键的是，41 个任务里 K3 一次都没能实现“任意代码执行”——这是最危险的攻击成果，意味着攻击者能完全控制目标机器，美国模型成功了 20 次。在模拟企业网络攻击的 TLO 测试里，K3 平均只能走完 32 步攻击路径中的 17 步，美国模型平均 28.5 步，K3 十次尝试里只有一次完整走通。

报告还提了一句，K3 的安全护栏没有阻止它帮忙搞攻击。这些表现跟之前“月之暗面蒸馏了更先进模型”的指控对得上——如果真是靠蒸馏学来的，那它更像是在模仿强模型的表面答案，而不是真正掌握了漏洞挖掘和利用的深层能力，一上硬核测试就容易露馅。不过正文没披露美国模型测试时是否也关了安全护栏，这点会影响对比的公平性。另外，K3 作为开源权重模型，成绩已经比中国的 GLM-5.2 好，说明中国模型在进步，但离美国前沿水平还有明显差距。
