# 他把 AI 助手公开让人攻击，2000 人试了，秘密文件没泄露

> 原标题：What happened after 2k people tried to hack my AI assistant

- 来源：Hacker News 首页
- 发布时间：2026-06-26T02:29:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40600
- 原文：https://www.fernandoi.cl/posts/hackmyclaw/

## 摘要

Fernando 把接入了 Claude Opus 4.6 的邮件助手 Fiu 挂到网上，悬赏让人套出 secrets.env 文件内容。帖子上了 Hacker News 首页后，Fiu 收到 6000 多封邮件，2000 多人用冒充管理员、伪造紧急事件、多语言诱导等方式尝试攻击。最终秘密没泄露，但 Gmail 账号因流量异常被谷歌封了三天，API 费...

## 推荐理由

两千人拿 6000 多封邮件做红队测试，攻击手法和防御 prompt 都公开了，干货够上 featured。扣分是因为这是个人实验，不是产品安全公告，Gmail 被封和 API 费用的具体数字也没展开。

## 锐评

Fernando 这个实验挺有意思：他把一个能读写邮件和文件的 AI 助手挂到公网，悬赏让人套出 secrets.env 文件内容。结果 6000 多封邮件、2000 多人变着花样攻击，秘密始终没泄露。这首先说明模型选型确实关键——他用了 Anthropic 专门做过注入对抗训练的 Claude Opus 4.6，换成小模型大概率扛不住。

不过有几个坑得说清楚。一是成本不低，API 费干出去 500 多美元，Gmail 还被谷歌当成异常流量封了三天。二是实验设计有局限：助手基本不回复邮件，攻击者只能单次试探，没法来回拉扯——而真实场景里多轮对话才是社工的杀伤力所在。另外作者自己也发现，批量处理邮件时前面的注入样本会污染后续判断，后来改成每次独立上下文才解决。

正文没披露 secrets.env 里具体放了什么、也没说攻击者如果拿到这个文件能造成多大实际损害。单看“没泄露”这个结果可以谨慎乐观，但别直接推导成“AI 助手已经安全了”——这里没有多轮交互、没有真实权限滥用测试，离生产环境还差得远。
