# 三元大模型打破 1.58 比特的存储下限：BITCOS 靠利用大量零权重把每权重压到 1.485 比特

> 原标题：Breaking the 1.58-bit Barrier for Ternary LLMs

- 来源：Hacker News 首页
- 发布时间：2026-09-16T20:59:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56947
- 原文：https://arxiv.org/abs/2609.16338

## 摘要

三元模型把每个权重存成 -1、0 或 +1，理论上每个权重至少需要约 1.585 比特，实际打包时通常要 1.625 比特。Intel 作者测了 29 个三元大模型，发现零权重占比最高能到 51.5%。他们据此提出 BITCOS，不再用固定打包，而是用一个位图标记哪些位置是零，再单独存非零权重的正负号，这样每权重的存储成本变成 2 减去零权重比例。在 ...

## 推荐理由

Intel 团队拿 29 个三元模型实测，发现零权重占比最高能到 51.5%，然后提出 BITCOS 编码——不再固定打包，而是用位图标记零位置、非零只存正负号，把每权重存储成本压到 2 减零权重比例，直接捅破 1.58 比特的地板。标题本身就勾人，对做推理优化的人有吸引力，但话题太窄，没有大众传播力，所以 H 和 K 都成立，R 不成立。

## 锐评

这条值得看，因为它没改模型，只改了权重怎么存。三元模型每个权重存成 -1、0 或 +1，理论上最少要 1.585 比特，实际打包通常要 1.625 比特。Intel 这帮人测了 29 个三元大模型，发现零权重占比最高能到 51.5%，也就是说一半以上的权重其实不干活。他们提出的 BITCOS 方法很简单：用一个位图标记哪些位置是零，再单独存非零权重的正负号。零越多越省，最稀疏的模型压到了 1.485 比特，比理论下限还低。在 29 个模型里，26 个都比传统打包更省空间。

实际跑起来也有收益。他们在 AVX-512、AVX2 和 Xe2 GPU 上做了优化解包，矩阵向量乘法最快能快 1.28 倍。端到端推理吞吐，CPU 上最高提升 18%，GPU 上最高提升 27%。

不过正文没披露这 29 个模型的名字和参数量，也没说是不是公开可用的。这点先别太激动——如果测的都是小模型或者自己训的，通用性要打折扣。另外，位图解包虽然加速了，但实际部署时内存带宽和缓存命中的影响没细说，这些才是端侧推理的真正瓶颈。
