# Kimi K3 技术报告：把模型做大，先得搞定显存、带宽、通信和延迟这四堵墙

> 原标题：Kimi K3 报告解读：当规模从一个旋钮变成一组受约束的生产要素

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-31T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48045
- 原文：https://yage.ai/share/kimi-k3-scaling-production-factors-20260731.html

## 摘要

Moonshot AI 放出了 Kimi K3 的技术报告，模型总参数 2.78 万亿，每次推理激活 1042 亿参数，总共 93 层，原生支持 100 万 token 上下文。但报告真正的看点不是参数大，而是他们怎么在真实硬件限制下做工程取舍。在序列处理上，他们用 69 层 KDA 以固定成本传递历史信息，再用 24 层 Gated MLA 做全局纠...

## 推荐理由

Moonshot AI 放出 Kimi K3 技术报告后，这篇解读绕开了“2.78 万亿参数”的标题党写法，直接拆他们怎么在真实硬件限制下做序列架构的取舍：69 层 KDA 控制成本，24 层 Gated MLA 做全局修正，整篇文章都在讲显存、带宽、延迟这些硬约束下的工程选择。对从业者来说，这比参数数字有用得多。

## 锐评

Kimi K3 这份报告最值得看的不是 2.78 万亿参数，而是它把 Scaling 从“无脑加参数”变成了在硬件限制下的一组工程权衡。报告里处处是这种取舍：序列处理上，69 层 KDA 用固定成本传递历史，24 层 Gated MLA 做全局纠错，3:1 的比例就是为了省 KV Cache 显存。深度上，93 层网络如果每层都做注意力寻址，跨卡通信会爆炸，所以他们把 93 层打包成 9 个 Block，只在 Block 之间做寻址，代价是放弃了 Block 内部更细粒度的特征复用。专家并行更典型，896 个专家每个 token 激活 16 个，为了不让 all-to-all 通信吃满带宽，先用 LatentMoE 把传输数据压缩一半，省下的带宽才够多激活专家。

训练信号这块，AgentENV 环境用物理 Verifier 直接检查代码是否跑通、数据库是否真改了，不给模型说漂亮话骗分的机会。后训练阶段，他们把领域和推理努力程度拆成 3×3 的二维矩阵，先训练 9 个专家 Teacher，再用 MOPD 蒸馏到一个模型里，解决多目标训练时的跷跷板效应。

报告没提具体的训练算力消耗和实际部署延迟数据，也没给出不同推理预算下的性能对比曲线。这些缺失让“省钱”的判断只能停留在架构分析层面，没法量化到底省了多少。
