# GRP-Obliteration：用一条没标注的提示词就能卸掉大模型的安全护栏

> 原标题：GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt

- 来源：Hacker News 首页
- 发布时间：2026-09-15T14:31:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56733
- 原文：https://arxiv.org/abs/2602.06258

## 摘要

这篇论文来自微软，作者包括 Mark Russinovich。他们提出了一种叫 GRP-Oblit 的方法，核心是用 GRPO（一种强化学习策略）直接抹掉模型的安全对齐。最让人警惕的是，只需要一条没标注过的提示词，就能稳定地让模型不再拒绝危险请求，同时基本保持原有能力不崩。他们在 15 个模型上做了测试，参数规模 7B 到 20B，覆盖了 GPT-OS...

## 推荐理由

微软安全团队出品，作者里有 Mark Russinovich，不是那种蹭热度的水文。方法、规模和结论都摆得清楚，而且“一条提示词就能洗掉对齐”这个说法，对任何在管模型安全的人来说都是个需要立刻确认的威胁。没给更高分是因为目前只看到摘要，复现细节和完整实验还没公开，我会先打个折。

## 锐评

这篇论文展示了一种叫 GRP-Oblit 的方法，核心是用强化学习策略 GRPO 直接抹掉模型的安全对齐。最让人警惕的是成本极低——只需要一条没标注过的提示词，就能稳定让模型不再拒绝危险请求，同时基本保持原有能力不崩。他们在 15 个模型上做了测试，参数规模 7B 到 20B，覆盖了 GPT-OSS、蒸馏版 DeepSeek、Gemma、Llama、Ministral、Qwen 六个家族，在五个安全基准上平均超过了现有最强方法。这个方法还能跨模态，对扩散模型做的图像生成器同样有效。

不过摘要没列出具体是哪五个安全基准，也没给出能力下降的量化数字。作者是微软的 Mark Russinovich 带队，论文挂在 arXiv 上，目前只有预印本。这点先别太激动——方法听起来很猛，但需要等独立复现才能确认是不是真的这么稳。另外，正文没披露那条提示词长什么样，也没说在不同模型上是不是用同一条，这些细节对评估实际威胁很关键。
