# AI 挖漏洞不是拼算力，模型智商才是天花板

> 原标题：AI cybersecurity is not proof of work

- 来源：Hacker News 首页
- 发布时间：2026-04-16T10:48:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16
- 原文：https://antirez.com/news/163

## 摘要

antirez 拿 OpenBSD 的 SACK 漏洞举例，说了一个反直觉的结论：用 AI 找代码漏洞，堆 GPU 多跑几次没用。因为代码能走的执行路径是有限的，跑再多轮也会饱和，最终卡住你的是模型本身的智商，而不是采样次数。弱模型就算给它无限的 token，也永远没法把“窗口校验缺失”“整数溢出”“不该为空的指针分支”这三件事串起来，所以找不到真漏洞...

## 推荐理由

antirez 这篇不是论文，更像一篇带实验的博客。核心判断很明确：AI 找漏洞的上限卡在模型本身的智力水平，不是 GPU 数量。他用 OpenBSD 的 SACK bug 做了个可复现的测试——弱模型就算给你无限 token，也串不起来窗口校验、整数溢出和 NULL 分支这三件事，路径会饱和。这个结论对天天在算成本和效果的人有用：与其无脑加采样，不如盯模型质量和获取速度。我会先打个折，正文没给大规模对比数据，更像单点验证，但逻辑链条清楚，值得一看。

## 锐评

antirez 这篇博客的核心判断很直接：用 AI 找代码漏洞，堆 GPU 多跑几次没用。他拿 OpenBSD 的 SACK 漏洞做了实测，发现弱模型就算给无限 token，也永远没法把“窗口校验缺失”“整数溢出”“不该为空的指针分支”这三件事串起来。代码能走的执行路径是有限的，采样次数再多也会饱和，最终卡住你的是模型本身的智商，而不是算力。

这个结论反直觉，但逻辑站得住。他还点出一个有意思的现象：中等强度的模型反而更少报告这个漏洞，因为它们幻觉更少，但又没聪明到能真正理解问题，两头不靠。不过文章没给出他测试的具体模型列表和采样次数，只说“GPT 120B OSS 便宜可用”，验证门槛不高但信息不够完整。

对做 AI 安全工具的人来说，这条提醒很实用：别光盯着 GPU 预算，模型质量和调用速度才是关键。但也要注意，他只测了一个漏洞案例，结论能不能推广到其他类型的 bug，正文没展开。
