# 开源模型网络攻击力追近闭源，Kimi K3 发布，Hassabis 提 AGI 监管方案

> 原标题：Import AI 465: Open vs closed gaps; Kimi K3; Demis&#8217; big policy plan

- 来源：Import AI
- 发布时间：2026-07-20T12:31:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46840
- 原文：https://jack-clark.net/2026/07/20/import-ai-465-open-vs-closed-gaps-kimi-k3-demis-big-policy-plan/

## 摘要

英国 AI 安全研究所（AISI）的测试显示，开源模型在网络安全任务上与闭源前沿模型的差距已从 2025 年的 6 到 10 个月，缩短到现在的 4 到 7 个月。具体来说，GLM-5.2 在 70 项细分网络能力评估中，表现接近 4.3 个月前发布的 Claude Opus 4.6；但在需要把多种能力串起来完成完整黑客操作的长时间任务上，差距会拉大，...

## 推荐理由

AISI第一次公开量化开源与闭源模型在网络能力上的时间差，有具体模型和月份数字，虽然只是网络安全这一个维度，但数据本身够硬，值得从业者关注。

## 锐评

英国AISI的测试给了一个具体的时间差：GLM-5.2在70项细分网络能力上，表现接近4.3个月前发布的Claude Opus 4.6，DeepSeek V4-Pro则介于Claude Opus 4.5和GPT-5之间。这个差距比2025年的6到10个月明显缩小了。不过，一旦任务变成需要把多种能力串起来完成一次完整黑客操作，差距就会拉大，GLM-5.2只能追到7个月前的水平，DeepSeek V4-Pro表现更弱。这说明开源模型在单项技能上能刷分，但综合运用的“大局观”还差一截，业内管这叫“大模型味儿”不足。

AISI的结论很直接：留给网络防御者准备的时间窗口在变短。今天还受控的前沿攻击能力，可能很快会以无安全限制的开源形式扩散。但正文没披露测试的具体难度和防御场景，所以这个“4到7个月”的紧迫感，得看实际攻击链的复杂度来打折。

另一边，Kimi K3这个2.8万亿参数的模型，跑分已经能摸到Claude Fable 5和GPT 5.6 Sol的边，还展示了48小时内设计芯片、写GPU编译器这类自我迭代的苗头。如果它的权重真在几周后公开，那意味着高性能AI会进一步脱离平台控制。好处是创业门槛更低，坏处是未知风险更多。不过，Kimi自己也暗示模型可能存在“刷榜”优化，泛化能力有短板，这点先别太激动。
