# 用 44 小时 RTX 5090 给 Gemma 4 E2B 做了 13 个“去限制”变体，有害指令成功率从 32% 飙到 82% 以上

> 原标题：13 abliterated Gemma 4 E2B variants, 44 GPU hours, Benchmark and Comparison - Abliterlitics

- 来源：r/LocalLLaMA
- 发布时间：2026-05-31T13:44:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30771
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tsvs3j/13_abliterated_gemma_4_e2b_variants_44_gpu_hours/

## 摘要

这篇帖子来自 Reddit 的 r/LocalLLaMA，作者 Abliterlitics 用 44 小时的 RTX 5090 算力，对 Gemma 4 E2B 模型做了 13 种不同强度的“去限制”（abliteration）处理。简单说，就是通过修改模型内部参数，削弱它对敏感问题的拒绝回答倾向。结果很直接：原版模型在 HarmBench 有害指令测...

## 推荐理由

我会先打个折：这只是一次个人发起的去审查实验，不是官方发布，结论别直接当生产依据。但文章把 13 个变体的基准分、GPU 开销和有害指令通过率都列清楚了，读起来像朋友在群里甩了一份跑分记录。对想了解 Gemma 4 安全边界、或者自己动手做 abliration 的人，这份数据比泛泛的讨论有用得多。

## 锐评

作者Abliterlitics对Gemma 4 E2B做了13种强度的“去限制”处理，把模型内部拒绝回答的倾向直接削掉。效果很猛：原版在有害指令测试里拒绝率67.8%，处理后攻击成功率飙到82%到100%，等于几乎不设防。数学推理倒没崩，GSM8K从83.5%微涨到84.8%，说明至少在这类任务上没被带偏。

但这条信息缺两个关键点。第一，44小时RTX 5090的算力成本没折算，不知道是个人跑着玩还是能复现的流程。第二，只测了有害指令和数学题，日常对话、事实准确性、长文本理解这些更常用的场景完全没提。去限制往往会让模型在边界问题上胡说八道，这点没验证就下结论说“只影响安全不影响能力”还太早。

另外，Reddit原文被网络屏蔽，摘要里的信息来自二手转述，具体实验设置和模型发布位置都不清楚。如果你是想拿这个做本地部署，建议先在自己业务场景里跑一圈，别只看这两个数字就上车。
