# 港理工和西工大发现：不用越狱词，换个问法就能让 22 个大模型全中招

> 原标题：伦理防线不可靠！分布偏移诱导，大模型进入暗黑模式

- 来源：新智元 · 公众号
- 发布时间：2026-04-18T10:15:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6626
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652693267&idx=3&sn=17ea7b53982442403a3b0f137fedc7db

## 摘要

这篇发在《自然·通讯》上的研究，测试了 26 个做过安全对齐的模型，结果 22 个攻击成功率 100%。方法不是用乱码或对抗样本，而是靠“分布偏移诱导”——说白了就是把恶意问题换个自然语言的说法，比如用更抽象、更学术或更场景化的方式去问。模型在预训练时学到的有害知识并没有被对齐彻底删掉，只是被盖住了，一旦提问方式偏离安全训练时的分布，这些知识就又冒出来...

## 推荐理由

HKR 三项都站得住：论文说普通连贯提示就能让 26 个对齐模型里的 22 个攻击成功率打到 100%，而且给出了机制解释，不只是刷了个 benchmark 数字。停在 84 分是因为这是一篇很强的安全研究，但不是模型发布或产品级事件，市场震动没那么大。

## 锐评

这篇《自然·通讯》的研究给安全对齐泼了盆冷水。他们测了 26 个模型，22 个攻击成功率 100%，方法不是用乱码或对抗样本，而是把恶意问题换个自然语言的说法——比如用更学术、更抽象的方式去问。模型在预训练时学到的有害知识并没有被对齐删掉，只是被盖住了，一旦提问方式偏离安全训练时的分布，这些知识就又冒出来。连 Llama 3.1 8B Instruct 都中招了。

这个发现对做安全的人挺扎心的：现在的主流对齐方法，更像是在模型表面刷了一层漆，而不是从根上把有害知识去掉。攻击成本极低，不需要梯度攻击，不需要特殊构造，换个说法就行。

不过正文没披露具体用了哪些恶意问题类型，也没说这 22 个模型分别是什么版本、什么规模。另外，攻击成功率 100% 是在什么评测标准下算出来的，原文也没展开。这点先别太激动，得看后续有没有更完整的复现和防御方案。
