# DeepSeek V4.1 Flash 在 Enclave 黑客基准测试中拿下 11/11 满分，总花费不到 5 美元

> 原标题：DeepSeek v4.1 Flash Is Now Our Best Hacking Model

- 来源：Hacker News 首页
- 发布时间：2026-09-16T12:19:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56898
- 原文：https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model

## 摘要

安全公司 Enclave 把 DeepSeek V4.1 Flash 扔进他们的黑客测试环境，让它攻击 11 个有漏洞的目标和 4 个已修复的对照目标。结果模型在所有 11 个目标上都拿到了代码执行权限，4 个对照目标则全部守住了。跑完这轮测试只花了 4.65 美元，算上失败重试的总成本也才 5.14 美元。模型总共执行了 2349 条 Bash 命令...

## 推荐理由

安全公司 Enclave 把 DeepSeek V4.1 Flash 扔进自己的渗透测试环境，让它攻击 11 个有漏洞的目标和 4 个已修复的对照目标。结果模型在所有漏洞目标上都拿到了代码执行权限，对照目标全部守住，攻防两端表现干净。总成本 4.65 美元，算上重试也才 5.14 美元，模型跑了 2349 条 Bash 命令。这个结果对安全从业者和 agent 开发者都有参考价值，但测试来自厂商自家环境而非第三方，所以重要性给了 82 分、放在 featured 位置，不往更高推。

## 锐评

Enclave 把 DeepSeek V4.1 Flash 扔进隔离环境，让它攻击 Grafana、Jenkins、Nextcloud 等 11 个有漏洞的目标和 4 个已修复的对照目标。结果模型在所有漏洞目标上都拿到了代码执行权限，对照目标全部守住，跑完一轮只花了 4.65 美元，算上失败重试总成本也才 5.14 美元。这个成本低得有点夸张，主要是因为 2.68 亿输入 token 里 99% 以上都命中了缓存，实际计费很少。

但别急着下结论说它是最强黑客模型。Enclave 事后审计发现，11 次成功里有 5 次走的不是预设攻击路径，而是测试环境里额外存在的“野路子”。比如 Grafana 那关，模型没按设计好的文件路径漏洞打，而是直接把可执行文件塞进临时插件目录，让 Grafana 当正常插件加载执行，最快 52 秒就拿下。这算漏洞利用，但不是原题想测的那个漏洞。Enclave 已经把这些额外路径堵上，要求后续重跑才能更新排行榜。

正文没披露模型在真实网络环境或未加固目标上的表现，也没提误报率。目前这更像一个“在已知有漏洞的靶场里找捷径”的测试，离自主渗透还有距离。
