跳到正文
Latent Space

推理工程大师课:Baseten 的 Philip Kiely 和 Ali Taha 聊怎么让模型跑得又快又省钱

The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten

Baseten 刚融了 130 亿美元,Philip 和 Ali 在这期播客里把推理工程拆开讲透了。他们聊了量化、投机解码、KV 缓存搬运、以及把预填充和解码拆开跑这些技术。一个 GLM-5.2 的实验发现,多量化几层反而让基准测试质量没掉,吞吐还涨了 20%,因为不同层引入的误差会互相抵消。他们还把 Kimi 的视觉编码器直接嫁接给 GLM-5.2,...

推荐理由:Baseten 刚融了 130 亿美元,让这期推理工程深度聊的时效性更强。GLM-5.2 的量化实验和 Kimi 视觉编码器嫁接是具体、少见的技术细节。分数定在 78 而不是更高,因为毕竟是播客文字稿——信息密度高,但结构不如正式技术报告紧凑。

读原文 ↗导出 Markdown