Moondream 用流水线解码挤掉 GPU 空闲气泡,解码吞吐量提升最高 35%
Popping the GPU Bubble
Moondream 的 Photon 推理引擎在 B200 上跑 VLM 能到 33 毫秒左右。瓶颈不在算力,在 GPU 气泡:每生成一个 token,GPU 都得等 CPU 做完记账、采样、调度这些杂活才能开始算下一个。Photon 把解码循环改成流水线,让 GPU 在当前 token 还没完全落地时就开始跑下一步计算,把 CPU 的杂活藏到 GPU...
推荐理由:Moondream 的 Photon 引擎在 B200 上把 VLM 推理压到 33 毫秒左右,解码吞吐提了 35%,数字和原理都交代得清楚。但这是单家公司的推理优化,不是行业级事件,受众偏窄,放在 featured 刚好。