有人盯着我的检测 API 打了半年对抗攻击,这三种套路最常得手
Been watching real adversarial input hit my detection API for six months. Here's what's actually landing.
Bordair 的作者把检测 API 挂了六个月,从真实流量里抓出三类反复出现的攻击模式:多轮铺垫、利用对话惯性往前推、以及直接给模型换人设。上个月公开的对抗游戏里大概产生了 6700 次攻击,说明这些手法不是实验室玩具,已经在线上跑了。正文没披露具体绕过率和误报率,这点先别太激动。
推荐理由:这篇文章来自一线实战,不是纸上谈兵。作者把检测 API 暴露在真实流量里半年,抓出多轮铺垫、对话惯性推进、换人设三类攻击模式,上个月对抗游戏里还产生了约 6700 次攻击,说明这些手法已经在线上跑了。对做安全检测的从业者来说,这些实战经验比 benchmark 更有参考价值。不过正文没披露具体绕过率和误报率,效果到底怎么样还得打个问号,所以分数没给更高。