OpenAI 发布 GPT-6 Astra:数学、编程、网络安全基准刷到顶,但没提参数量和成本
OpenAI 发布 GPT-6 Astra:多项基准刷新纪录, cybersecurity 能力达 Critical 阈值
OpenAI 推出了自称最聪明、对齐最好的模型 GPT-6 Astra。它在 FrontierMath Tier 4 上拿了 98%,ARC-AGI-3 上拿了 99.9%,ExploitBench 直接满分 100%,说明做数学题、适应新环境、找漏洞的能力都拉满了。在模拟越权测试里,Astra 一次都没越界,而上代 GPT-5.6 Sol 有 48%...
推荐理由:OpenAI 的新旗舰一口气刷爆三个高难度基准,还明确把网络安全能力标到 Critical 级别,并拿上一代模型的对齐数据做直接对比。这种发布今天一定会被所有 AI 媒体铺满。没给 100 分是因为正文没提实际开放节奏和外部复现情况,这些缺口让满分站不住。