# GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos，而且人人都能用

> 原标题：GPT-5.5: Mythos-Like Hacking, Open to All

- 来源：Hacker News 首页
- 发布时间：2026-04-23T18:16:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9088
- 原文：https://xbow.com/blog/mythos-like-hacking-open-to-all

## 摘要

安全公司 XBOW 用真实漏洞库测了 GPT-5.5，漏报率压到 10%，比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是，GPT-5.5 不看源码（黑盒）的效果已经超过了 GPT-5 看源码（白盒）的水平；一旦给它源码，性能直接拉爆，把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里，它登录成功的交互轮次只有...

## 推荐理由

我会先打个折：数据来自 XBOW 自家的漏洞基准，不是 OpenAI 官方发布，所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%，比 GPT-5 有源码时的 40% 低了一大截，也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%，登录目标系统需要的尝试次数直接砍半，说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力，这点先别太激动，正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说，这个信号足够盯紧了：模型在没看到源码的情况下已经能...

## 锐评

安全公司 XBOW 用真实漏洞库测了 GPT-5.5，漏报率从 GPT-5 的 40% 一路压到 10%，比 Opus 4.6 的 18% 也低一截。更关键的是，GPT-5.5 不看源码（黑盒）的效果已经超过了 GPT-5 看源码（白盒）的水平；一旦给它源码，性能直接拉爆，XBOW 说自己的基准被“杀穿”了。在模拟登录这类实操任务里，它的视觉准确率到了 97.5%，交互轮次也只有次优模型的一半左右。

不过得先打个折。这是 XBOW 自家的基准，漏洞库和测试流程没公开，没法复现。而且文章只给了漏报率，没提误报率——如果模型为了不漏报而疯狂报警，实际用起来会很吵。另外，XBOW 本身就是卖安全产品的，评测结果天然带推广属性，这点先别太激动。

还缺什么：没看到跟 Mythos 的直接对比数据，只是标题打了个比方；也没披露测试的漏洞总数和类型分布，不知道是偏 Web 还是偏二进制。如果后续有第三方用公开基准交叉验证，这个 10% 的漏报率才更有说服力。
