# Moonshot 说 Kimi Linear 能让 KV 缓存跨数据中心传输，实测吞吐量提升 1.54 倍、首 token 延迟降 64%

> 原标题：Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter

- 来源：r/LocalLLaMA
- 发布时间：2026-04-18T16:20:57.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6317
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1sp216x/prefillasaservice_kvcache_of_nextgeneration/

## 摘要

Moonshot 提出一种叫“预填充即服务”的玩法，把大模型推理拆成预填充和解码两个阶段，分别跑在不同数据中心甚至不同硬件上。核心靠的是他们 Kimi Linear 模型，KV 缓存体积小到可以跨机房传。用放大 20 倍的模型测，吞吐量提到 1.54 倍，P90 首 token 延迟降了 64%。不过帖子本身被 Reddit 安全策略挡了，正文没披露具...

## 推荐理由

HKR 三项都站得住：跨数据中心传 KV Cache 这个点够新，文章也拿出了 1.54 倍吞吐和 P90 TTFT 降 64% 的具体数字，预填充与解码解耦的机制也交代了。我只给 80 分，因为目前还是二手摘要，成本基准、确切规模和复现细节正文都没披露，得等 arXiv 论文出来再看。

## 锐评

这条思路挺直接：把大模型推理的“读题”和“写答案”拆开，分别放在不同机房甚至不同硬件上跑。能这么干的前提是 Kimi Linear 模型的 KV 缓存足够小，小到跨数据中心传输不拖后腿。用放大 20 倍的模型测，吞吐量提到 1.54 倍，P90 首 token 延迟降了 64%，说明对长上下文或高并发场景确实能省时间。

不过现在能看到的只有 Reddit 帖子的标题和摘要，正文被安全策略挡了，成本数字、跨机房网络条件、不同模型尺寸下的表现都没披露。这点先别太激动，得等 arXiv 论文放出来才能判断这方案在真实网络延迟和异构硬件上到底划不划算。另外，帖子没提这玩法对模型架构有没有硬性要求，如果只绑 Kimi Linear 一家，通用性就得打个折。
