用强化学习让 Qwen3.5 自己攻自己,再把失败案例喂回去加固防线
I trained Qwen3.5 to jailbreak itself with RL, then used the failures to improve its defenses
作者搭了一套全自动的红队演练循环:先训练一个攻击模型,用强化学习(GRPO)对着 Qwen3.5 不断尝试越狱,成功诱导出有害回答就给奖励。第一轮攻击很快塌缩成同一种“写小说”套路,翻来覆去就一招。后来他们把攻击按底层策略聚类,奖励除以该策略的使用次数,逼攻击模型去挖新花样,这才炸出 7 类不同的越狱手法,其中虚构创作类占比最高,达 34%。接着用这些...
推荐理由:我会先打个折:这是 Reddit 个人帖,没挂论文也没开源代码,数字只能当参考。但故事本身挺有意思——作者没靠人工写攻击样本,而是用强化学习让 Qwen3.5 自己琢磨怎么越狱,再把翻车案例拿来加固模型,形成一个自动红队闭环。防御率从 64% 跳到 92% 看着漂亮,不过良性准确率从 92% 跌到 88%,说明模型变保守了,正常问题也开始拒答。攻击器挖出 7 类策略,正文没展开细节,不知道覆盖面和实际危害有多大。整体像一份个人实验笔记,有启发但缺验证,先别太激动。