跳到正文
Hacker News 首页

Mythos 真那么神?一个盲测把各家模型拉出来找安全漏洞,结果都挺吃力

Will It Mythos?

作者把 Anthropic 用 Mythos 发现的 9 个真实漏洞做成了盲测基准:给模型完整的源码树和要审查的文件,不给任何提示,看谁能找出漏洞。结果所有模型表现都低于预期。Gemma 4 MoE 以 4/9 的检出率暂时领先,但它中途崩溃重试了好几次;GPT 5.5 Pro 只跑了 4 个案例就烧掉了 100 美元预算,2/4 的成绩参考意义有限。...

推荐理由:作者用 Anthropic 自己披露的 Mythos 发现的 9 个真实漏洞搭了个盲测基准,给模型完整源码树但不给任何提示,看谁能找出漏洞。结果所有模型表现都低于预期,Gemma 4 MoE 以 4/9 暂时领先但中途崩溃重试了好几次,GPT 5.5 Pro 只跑了 4 个案例就烧掉 100 美元预算,2/4 的成绩说明不了太多问题。这是第一个用真实 Mythos 漏洞做的公开盲测,对想用模型辅助代码审计的团队来说,数据虽然少但很直接。

读原文 ↗导出 Markdown