# OpenAI 确认 Astra 模型达到网络安全“Critical”级别，将限制其最强攻击能力的使用范围

> 原标题：OpenAI 评定 Astra 达到网络安全 Critical 能力阈值，将受限发布

- 来源：AI HOT 精选
- 发布时间：2026-09-01T13:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54141
- 原文：https://openai.com/index/path-to-astra

## 摘要

OpenAI 在 9 月 1 日确认，Astra 模型已触及自家《准备框架》中网络安全能力的最高档“Critical”。这意味着，给它合适的工具和权限，它就能在没人手把手指导的情况下，自己在很多加固过的系统里找到未知漏洞，并拼出完整的攻击链。内部测试里，Astra 在 ExploitBench 上拿了满分，还用出了两个零日漏洞。OpenAI 因此推迟了...

## 推荐理由

OpenAI 官方博客确认 Astra 触发了自家《准备框架》里网络安全的最高档 Critical，有硬证据（ExploitBench 满分、两个零日漏洞），并宣布限制发布。这是第一次有大厂用具体测试结果把自己的模型标到 Critical 并配上真实防护措施，不是空喊风险。我会先打个折：正文没披露那两个零日漏洞的严重程度和影响范围，也没说限制发布具体怎么执行，所以别急着脑补成天塌了。但光凭‘满分+真实零日+官方认账’这三点，已经足够让这篇东西成为本周最该被看见的文章。

## 锐评

OpenAI 这次没绕弯子，直接说 Astra 是他们第一个达到自家《准备框架》里网络安全“Critical”级别的模型。翻译成人话就是：给 Astra 合适的工具和权限，它不用人手把手教，就能在很多加固过的系统里自己找到未知漏洞，并拼出完整的攻击链。内部测试里，它在 ExploitBench 上拿了满分，还实打实用出了两个零日漏洞，这比之前 GPT-5.6 Sol 强了一大截。

OpenAI 因此推迟了部分开发，先给模型加了几层保险：训练它更可靠地拒绝恶意请求、加滥用防护、部署监控。最猛的攻击能力不会直接开放，先给一小批测试者用，再通过 Daybreak Blue 项目开放给防御方。但正文没提具体发布时间和定价，也没说这些防护措施在真实对抗里能撑多久。

目前看，OpenAI 把牌摊得比较明，但关键信息还缺两块：一是外部独立红队的验证结果，二是模型被恶意微调或越狱后的表现。如果是真的，这模型省钱省事的能力很强，但安全边界到底在哪，还得等系统卡和实际部署后的反馈。
