OpenAI 的 Astra 模型快来了,它很擅长攻破电脑系统
OpenAI’s Astra model is on the way — and very good at breaking into computer systems
OpenAI 公布了 Astra 的安全细节,这是他们第一个达到“关键网络安全门槛”的大语言模型。Astra 能在没人指导的情况下,自己发现并利用电脑系统里未知的安全漏洞。OpenAI 打算近期发布,但会限制它最强网络安全能力的访问权限。这跟 Anthropic 今年早些时候对自家 Mythos 模型的担忧很像,OpenAI 也采取了类似的预防措施。
推荐理由:OpenAI 第一次公开 Astra 的安全评估,确认模型已经跨过自主漏洞利用的门槛,并计划做权限管控。这和 Anthropic 今年早些时候处理 Mythos 的思路几乎一样,是 2026 年第二家顶级实验室因为模型太能“黑”而主动设限。正文没给出具体发布时间和技术细节,但“近期发布+限制访问”这个组合本身就说明他们内部评估风险不小。