ICLR 2026 | ProSafePrune:用低秩剪枝治大模型过度防御,不训练、不拖慢推理
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学和讯飞团队提出 ProSafePrune,一种低秩参数剪枝方法,专门解决大模型“过度防御”——把正常请求也误判为有害而拒绝回答。做法是用 SVD 把模型中间层的参数空间拆成安全、有害和伪有害三个子空间,然后剪掉重叠的“过度有害”方向。在 LLaMA-2-7B 上,OR-Bench 合规率从 11.0% 跳到 73.0%,安全评分只掉了不到 ...
推荐理由:我会先打个折:这是篇研究论文,不是产品发布,所以放 featured 而不是 p1。但 HKR 三项全中——用剪枝来缓解过度拒答这个思路本身就够反直觉,正文给了 7B-70B 的规模、OR-Bench 从 11.0% 到 73.0% 的跳升,以及 SVD 拆子空间的机制,信息量够。更关键的是它不增加训练和推理成本,这点对实际部署太友好了,从业者一看就懂价值在哪。安全分数只是“小幅下降”,MMLU 还升了,说明不是牺牲有用性换的。