# ICLR 2026 | ProSafePrune：用低秩剪枝治大模型过度防御，不训练、不拖慢推理

> 原标题：ICLR 2026 | ProSafePrune：一剪见效，告别大模型过度防御

- 来源：机器之心 · 公众号
- 发布时间：2026-04-22T03:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/8959
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651029279&idx=3&sn=02bdb72b39ffa9f625eb23a58db2e4e7

## 摘要

合肥工业大学和讯飞团队提出 ProSafePrune，一种低秩参数剪枝方法，专门解决大模型“过度防御”——把正常请求也误判为有害而拒绝回答。做法是用 SVD 把模型中间层的参数空间拆成安全、有害和伪有害三个子空间，然后剪掉重叠的“过度有害”方向。在 LLaMA-2-7B 上，OR-Bench 合规率从 11.0% 跳到 73.0%，安全评分只掉了不到 ...

## 推荐理由

我会先打个折：这是篇研究论文，不是产品发布，所以放 featured 而不是 p1。但 HKR 三项全中——用剪枝来缓解过度拒答这个思路本身就够反直觉，正文给了 7B-70B 的规模、OR-Bench 从 11.0% 到 73.0% 的跳升，以及 SVD 拆子空间的机制，信息量够。更关键的是它不增加训练和推理成本，这点对实际部署太友好了，从业者一看就懂价值在哪。安全分数只是“小幅下降”，MMLU 还升了，说明不是牺牲有用性换的。

## 锐评

这条思路挺直接：大模型安全对齐做过头，把正常请求也当有害内容拒了，他们管这叫“过度防御”。ProSafePrune 的做法是把模型中间层的参数用 SVD 拆成安全、有害和伪有害三个子空间，然后剪掉重叠的“过度有害”方向。在 LLaMA-2-7B 上，OR-Bench 合规率从 11.0% 拉到 73.0%，安全评分只掉了不到 1 个点，MMLU 还从 37.1 涨到 39.6。

对干活的人来说，好处是零额外训练、零推理开销，剪完直接用。方法在 7B 到 70B 的模型上都试过，说明不是只在小模型上碰运气。但文章正文因为微信验证墙没抓到，具体剪了多少参数、不同层的剪枝比例、以及安全评分“不到 1 个点”的精确数字都没法核实。

这点先别太激动：合规率从 11% 跳到 73% 确实猛，但 OR-Bench 本身覆盖的场景有多广、是不是只测了某一类过度拒答，正文没披露。另外安全评分只掉不到 1 个点，听起来很美，但得看这个评分是怎么算的——如果基准本身对安全边界画得粗，那掉一点可能掩盖了某些细粒度风险。建议等论文原文出来，重点看他们在哪些安全维度上做了让步。
