# TogetherAI 搞了个真 2-bit 的 KV 缓存压缩方案 OSCAR，长上下文推理能跑更快

> 原标题：超越TurboQuant，面向长上下文推理的真2-bit KV Quantization算法问世

- 来源：机器之心 · 公众号
- 发布时间：2026-05-29T04:04:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30501
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651035616&idx=3&sn=77117cdc692cf9180e0a36a494e98f6c

## 摘要

TogetherAI 和合作方发布了 OSCAR，一个把 KV 缓存压到平均每个值只占 2.28 比特的压缩系统，已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里，解码速度最高能到原来的 3 倍；在固定显存预算下，整个任务吞吐量最高能到 7 倍。正文没披露具体模型和测试硬件，也没说精度损失有多大，这点先别太激动。

## 推荐理由

我会先打个折：这是推理优化层的专项工作，不是模型发布，受众偏工程。但 100k 上下文 decode 约 3 倍加速、吞吐约 7 倍这两个数够硬，对跑长上下文推理的团队有直接参考价值。正文没披露精度损失的具体对比，这点先别太激动。整体值得放进 featured，让做推理部署的人看到。

## 锐评

TogetherAI 搞了个叫 OSCAR 的压缩方案，把模型推理时暂存的键值缓存（KV Cache）压到平均每个值只占 2.28 比特，已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里，解码速度最高能到原来的 3 倍；固定显存预算下，整个任务吞吐量最高能到 7 倍。这两个数字说明，如果你跑长文本任务，显存压力会小很多，或者同样硬件能塞更多请求。

但正文没披露测试用的具体模型和硬件配置，也没说压缩后精度损失有多大。2.28 比特是平均比特数，不同层、不同位置的压缩率可能不一样，实际效果得看具体任务。另外，这套方案已经集成进 SGLang，意味着你可以直接试用，不用自己从头实现。

还缺的信息：精度对比数据、支持的模型列表、以及压缩对短上下文场景的影响。这些没给，就只能说它在长上下文场景下显存省得明显，但能不能直接上生产还得自己测。
