# Mythos 真那么神？一个盲测把各家模型拉出来找安全漏洞，结果都挺吃力

> 原标题：Will It Mythos?

- 来源：Hacker News 首页
- 发布时间：2026-06-23T04:15:04.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40038
- 原文：https://swelljoe.com/post/will-it-mythos/

## 摘要

作者把 Anthropic 用 Mythos 发现的 9 个真实漏洞做成了盲测基准：给模型完整的源码树和要审查的文件，不给任何提示，看谁能找出漏洞。结果所有模型表现都低于预期。Gemma 4 MoE 以 4/9 的检出率暂时领先，但它中途崩溃重试了好几次；GPT 5.5 Pro 只跑了 4 个案例就烧掉了 100 美元预算，2/4 的成绩参考意义有限。...

## 推荐理由

作者用 Anthropic 自己披露的 Mythos 发现的 9 个真实漏洞搭了个盲测基准，给模型完整源码树但不给任何提示，看谁能找出漏洞。结果所有模型表现都低于预期，Gemma 4 MoE 以 4/9 暂时领先但中途崩溃重试了好几次，GPT 5.5 Pro 只跑了 4 个案例就烧掉 100 美元预算，2/4 的成绩说明不了太多问题。这是第一个用真实 Mythos 漏洞做的公开盲测，对想用模型辅助代码审计的团队来说，数据虽然少但很直接。

## 锐评

这个测试挺有意思：作者把 Anthropic 藏着掖着的 Mythos 系统找到的 9 个真实漏洞，打包成一个盲测基准。模型拿到完整的源码树和要审查的文件，不给任何提示，纯靠自己找。结果所有模型表现都低于预期。Gemma 4 MoE 以 4/9 的检出率暂时排第一，但它中途崩溃重试了好几次，稳定性存疑。GPT 5.5 Pro 只跑了 4 个案例就烧掉了 100 美元预算，2/4 的成绩参考意义有限。

这里有几个关键限制得说清楚。第一，样本太小，只有 9 个漏洞，而且每个模型只跑了一次，排名只能看个方向。第二，正文没披露 Mythos 自己在同样设定下的成绩，所以没法判断这个差距到底有多大。第三，作者推测 Mythos 可能用了更高级的工具，比如调试器或模糊测试，而这次测试只给了基础工具，对被测模型不太公平。

还缺什么？最核心的是 Mythos 的对照数据。另外，多跑几轮取平均值、扩大漏洞样本量，才能让结论更可靠。如果 Mythos 真像 Anthropic 说的那么强，那它在这个基准上应该能拉开明显差距，但目前我们看不到这个数字。
