玻璃翼项目:Mythos 模型在漏洞挖掘上能做什么,以及它为什么还不稳定
玻璃翼项目:Mythos向我们展示了什么
Cloudflare 在自家代码仓库上测试了 Anthropic 的 Mythos Preview 模型,发现它比之前的通用模型强在两点:一是能把几个小漏洞串成一条完整的攻击链,推理过程像资深研究员;二是能自己写代码触发漏洞、编译运行,失败了会调整假设再试,直到拿出可用的验证脚本。但模型也有毛病,它有时会拒绝做合法的漏洞研究,换个说法或环境又同意了,这...
推荐理由:Cloudflare 这篇是实操观察,把 Mythos 这类安全模型扔进关键基础设施的实时代码测试里,发现它能揪漏洞,但也会误报,而且上下文一长就不稳。我会先打个折:正文没给样本量,也没给准确率、召回率这些硬指标,所以只能当经验分享看,不能当评测结论。不过它碰的问题很实在——安全模型在真实生产环境里到底靠不靠谱,这点先别太激动,但值得跟。