# Cloudflare 开源 Unweight：把大模型权重压缩 22%，输出结果一个字节都不差

> 原标题：Unweight: how we compressed an LLM 22% without sacrificing quality

- 来源：r/LocalLLaMA
- 发布时间：2026-04-19T09:06:39.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6413
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1spnx1l/unweight_how_we_compressed_an_llm_22_without/

## 摘要

Cloudflare 发了一个叫 Unweight 的压缩方案，专门解决大模型在 GPU 上跑时被显存带宽卡脖子的问题。它只压缩 BF16 格式里的指数位，不碰尾数，所以解压后能还原出完全一致的输出。实测一个 8B 模型能省下约 3GB 显存，压缩率在 15% 到 22% 之间。原理是模型某一层里超过 99% 的权重只用到 16 种指数值，Unweig...

## 推荐理由

Cloudflare 这篇 Unweight 的卖点很直：不改模型输出，把权重无损压缩 15% 到 22%。他们盯的是 BF16 里浪费的指数字节，发现大部分层的指数值就那么几个，所以只压这部分。8B 模型能省出 3GB 显存，对跑 H100 的人来说是实打实的成本优化。我会先打个折——正文没给吞吐实测数字，也没说哪些模型能用，片上解压和动态执行管线听起来有料但细节没展开。这点先别太激动，等他们补上实测再判断实际收益。

## 锐评

Cloudflare 放出的 Unweight 方案思路挺巧：它发现模型某一层里超过 99% 的权重只用到 16 种指数值，于是只压缩 BF16 格式里的指数位，不动尾数，解压后输出和原来完全一致。对一个 8B 模型，这能省下约 3GB 显存，压缩率在 15% 到 22% 之间。

它的卖点是“无损”和“省显存带宽”，专门针对 H100 这类 GPU 上推理被显存带宽卡脖子的情况。方案里还提到片上解压和四条自动调优的执行路径，听起来工程上做了不少适配。

但这条帖子本身是从 Reddit 抓取的摘要，原文链接返回了 403，我们看不到完整的技术细节。最关键的信息——压缩后实际推理吞吐量提升了多少、延迟有没有增加、支持哪些模型架构——正文都没披露。没有这些数字，就没法判断这 22% 的压缩率到底能转化成多少实际收益。另外，方案是否开源、能不能在消费级显卡上跑，目前也不清楚。
