用 85 个 GPU 小时,把 Qwen3.6-27B 的 5 种“去安全限制”方法拉出来比了比
85 GPU-hours comparing 5 abliteration methods on Qwen3.6-27B: benchmarks, safety, weight forensics - Abliterlitics
这篇 Reddit 帖子被网络屏蔽了,正文内容没拿到,只能根据标题和现有摘要说个大概。作者花了 85 个 GPU 小时,在 Qwen3.6-27B 模型上对比了 5 种 abliteration(去掉模型安全限制)方法,跑了一堆基准测试、HarmBench 安全评测、KL 散度(看输出分布变化)和权重分析。摘要里提到,Huihui 方法对模型原本能力的...
推荐理由:这篇不是实验室通稿,是实打实的 85 GPU 小时对比实验。5 种去审查方法在 Qwen3.6-27B 上跑完,给出了基准测试掉分、KL 散度和安全拒答移除率三个维度的数据。Huihui 掉分最少,Heretic 最像原版,但所有变体都几乎把安全护栏拆干净了——这点先别太激动,正文没披露这些变体在真实对抗场景下的表现,也没说拆掉拒答后模型会不会乱说话。对想用开源模型又需要绕过安全限制的人,这份对比能省不少试错成本。