# SGLang 和 Miles 在发布当天就接住了月之暗面 2.8 万亿参数 Kimi K3 模型

> 原标题：SGLang 和 Miles 为月之暗面 2.8T 参数 Kimi K3 模型提供发布当日支持

- 来源：AI HOT 精选
- 发布时间：2026-07-27T17:50:17.260Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46958
- 原文：https://www.lmsys.org/blog/2026-07-27-kimi-k3-day0-support

## 摘要

Kimi K3 是个 2.8 万亿参数的混合模型，架构上把大多数推理框架的默认假设都打破了。SGLang 和 NVIDIA 合作，在发布当天就搞定了推理支持，Miles 则负责强化学习训练。核心工作包括：为 KDA 线性注意力和 MLA 这两种状态重写了内存管理，让那个会自我覆盖的循环状态也能用上前缀缓存和投机解码；用专门为 K3 训练的 DSpark...

## 推荐理由

我会先打个折，因为这篇文章本质上是工程适配记录，不是对 Kimi K3 模型能力本身的评测。但发布当天就搞定 2.8T 参数模型的推理和训练支持，还公开了 KDA 内存管理、统一内存池、投机解码这些具体做法，对从业者来说信息密度够高。第一句直接点出当天支持这个事实，然后解释为什么难、怎么做、谁用得上，不补设定，不写公关词。

## 锐评

这条新闻最值得看的是工程团队怎么把 K3 这种“反常规”架构塞进现有推理框架。K3 用了 69 层 KDA 线性注意力和 24 层 MLA，状态会自我覆盖，传统的内存管理和前缀缓存全得重写。SGLang 的做法是把两种状态放进统一内存池，省去了手动调参的麻烦；再用专门训练的 DSpark 小模型做投机解码，单请求解码速度从 113 tok/s 提到 423 tok/s。并行策略也按阶段拆分：预填充用分块流水线并行，解码用上下文并行，最终单卡吞吐冲到 2633 tok/s。训练侧，Miles 直接在原生 MXFP4 精度上跑 LoRA RL，12 小时就把 AIME-2024 正确率从 43.3% 拉到 76.7%，这个提升幅度挺实在。不过文章没披露多卡集群的总成本和长上下文下的性能衰减，实际部署前还得自己测一下。
