# 推理工程大师课：Baseten 的 Philip Kiely 和 Ali Taha 聊怎么让模型跑得又快又省钱

> 原标题：The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten

- 来源：Latent Space
- 发布时间：2026-08-03T21:44:03.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49791
- 原文：https://www.latent.space/p/inference-eng

## 摘要

Baseten 刚融了 130 亿美元，Philip 和 Ali 在这期播客里把推理工程拆开讲透了。他们聊了量化、投机解码、KV 缓存搬运、以及把预填充和解码拆开跑这些技术。一个 GLM-5.2 的实验发现，多量化几层反而让基准测试质量没掉，吞吐还涨了 20%，因为不同层引入的误差会互相抵消。他们还把 Kimi 的视觉编码器直接嫁接给 GLM-5.2，...

## 推荐理由

Baseten 刚融了 130 亿美元，让这期推理工程深度聊的时效性更强。GLM-5.2 的量化实验和 Kimi 视觉编码器嫁接是具体、少见的技术细节。分数定在 78 而不是更高，因为毕竟是播客文字稿——信息密度高，但结构不如正式技术报告紧凑。

## 锐评

这期播客把“推理工程”从玄学拉回到工程层面，最值钱的是 GLM-5.2 那个量化实验：多量化几层，基准测试质量没降，吞吐还涨了 20%。原因很反常识——不同层引入的误差会互相抵消，而不是叠加。这直接挑战了“量化越少越好”的惯性思维，如果是真的，能省下不少算力成本。

他们还聊了把 Kimi 的视觉编码器直接嫁接给 GLM-5.2，不动语言模型本身，这种“换零件”的思路对做多模态产品的团队很有参考价值。播客提到了投机解码、KV 缓存搬运、预填充和解码拆开跑这些技术，但正文没展开讲具体怎么落地，也没给延迟或成本的对比数据。

另外，播客还触及了 NVIDIA Dynamo、Rubin、视频生成和本地推理，但文章完全没展开，这部分信息缺口比较大。整体看，这期适合想从“能用”走到“用得起”的工程师，但别指望拿到即插即用的方案，更多是思路和方向。
