GPT-6 Astra 幻觉变少,但藏在文档里的指令仍能骗过它
GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击
OpenAI 新模型 GPT-6 Astra 比上一代 GPT-5.6 Sol 更少胡编事实,对直接提示词注入的拦截率做到 99.99%。但在安全公司 Gray Swan 的测试里,攻击者把恶意指令藏在 Astra 要读的文档中,用 1810 组精心构造的攻击反复尝试,Astra 仍有 8.5% 的概率中招。Claude Opus 5 在同一测试里失败...
推荐理由:GPT-6 Astra 的安全测试结果有具体数字和竞品对比,对从业者直接有用。没给更高分是因为文章只披露了部分测试细节,Gray Swan 的完整方法正文里没展开说清楚。