# Together AI 把 2-bit KV Cache 压缩真的跑在了线上服务里

> 原标题：超越TurboQuant：Together AI把2-bit KV Cache推向真实服务

- 来源：量子位 · 公众号
- 发布时间：2026-06-04T08:26:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34436
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247895048&idx=3&sn=c800a6ca1334742600bae6a37295cb19

## 摘要

Together AI 和悉尼大学、UIUC 搞了个叫 OSCAR 的 2-bit KV Cache 压缩方案，每个 KV 元素实际只占约 2.28 bit，在 Qwen3-4B-Thinking 上跑分 71.86，比 TurboQuant 高出 40.1 分。简单说就是把模型推理时占显存的大头——键值缓存——压到极低精度，还尽量不丢性能。正文没披露...

## 推荐理由

HKR 三项都站得住：OSCAR 把 2-bit KV Cache 从纸面推到线上，还给了实打实的分数和对比。不过话题本身还是底层推理优化，放 featured 比放头条更合适，做推理基建的人会点进去看。

## 锐评

这条新闻的核心是把模型推理时占显存的大头——键值缓存（KV Cache）——压到了 2-bit 精度，每个元素实际只占约 2.28 bit。在 Qwen3-4B-Thinking 上跑分 71.86，比 TurboQuant 高出 40.1 分，说明压缩后模型思考能力没崩，这点挺难得。

不过正文因为微信环境异常没加载全，关键信息缺了不少：延迟涨了多少、实际显存省了多少、在更大模型上效果怎么样，这些都没披露。2-bit 压缩听着很美，但如果解码速度掉一半，或者只在 4B 小模型上验证过，那离"推向真实服务"还有距离。

我会先打个折：分数提升是实打实的，但没看到吞吐和延迟数据前，别急着当省钱方案。另外论文来自 Together AI 和悉尼大学、UIUC，开源可能性大，等代码放出来跑一下长文本场景才见真章。
