# Modal 公开万亿参数编码 Agent 推理优化细节：单副本性能提升 2.8 倍，把烧钱服务做到价格有竞争力

> 原标题：Modal 详解如何以万亿 token 规模服务 Kimi K2.6 编码 Agent 推理

- 来源：AI HOT 精选
- 发布时间：2026-09-23T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58447
- 原文：https://modal.com/blog/trillion-tokens-trillion-parameters

## 摘要

Modal 工程团队写了一篇长文，拆解他们怎么为 Moonshot AI 的 Kimi K2.6 模型做推理加速，用来驱动编码 Agent。核心成果是把单副本（replica）性能提了 2.8 倍（按单用户交互体验算）和 5.6 倍（按多用户并发吞吐算），让原本贵到没法用的服务变得价格有竞争力。文章先讲工作负载：万亿参数的混合注意力 MoE 模型，输入...

## 推荐理由

Modal 这篇工程拆解直接甩出两个硬数字：单副本交互体验提了 2.8 倍，多用户并发吞吐提了 5.6 倍，对搞推理优化的人来说是能直接拿来对标的参考。没给更高分是因为这属于基础设施层的优化，不是模型能力或产品更新；但文章把万亿参数 MoE 模型怎么从贵到用不起做到价格有竞争力讲清楚了，对从业者有实际价值。

## 锐评

Modal 这篇工程文章讲的是怎么给 Moonshot AI 的万亿参数模型 Kimi K2.6 做推理加速，用来跑编码 Agent。核心成果是把单副本性能按单用户体验提了 2.8 倍，按多用户并发吞吐提了 5.6 倍。翻译成人话就是，原来跑一次推理贵得离谱，现在能把成本压到可以商业化运营的水平。他们一个服务一天能处理上千亿个 token，累计跑过上万亿。

文章花了很大篇幅讲怎么分析混合注意力 MoE 模型的工作负载，但关键信息有缺口：没写具体用的是什么型号的 GPU，也没给单次请求的延迟数据。这就像告诉你车很快，但不告诉你发动机排量和百公里加速。不过，他们分享的优化思路对做大规模推理部署的工程师有参考价值，尤其是怎么在单卡上同时兼顾用户体验和系统吞吐。
