跳到正文
Hacker News 首页

GRP-Obliteration:用一条没标注的提示词就能卸掉大模型的安全护栏

GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt

这篇论文来自微软,作者包括 Mark Russinovich。他们提出了一种叫 GRP-Oblit 的方法,核心是用 GRPO(一种强化学习策略)直接抹掉模型的安全对齐。最让人警惕的是,只需要一条没标注过的提示词,就能稳定地让模型不再拒绝危险请求,同时基本保持原有能力不崩。他们在 15 个模型上做了测试,参数规模 7B 到 20B,覆盖了 GPT-OS...

推荐理由:微软安全团队出品,作者里有 Mark Russinovich,不是那种蹭热度的水文。方法、规模和结论都摆得清楚,而且“一条提示词就能洗掉对齐”这个说法,对任何在管模型安全的人来说都是个需要立刻确认的威胁。没给更高分是因为目前只看到摘要,复现细节和完整实验还没公开,我会先打个折。

读原文 ↗导出 Markdown