# 让 GPU 别闲着：用异步批处理榨干推理性能

> 原标题：解锁连续批处理中的异步性

- 来源：AI HOT 精选
- 发布时间：2026-05-14T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20630
- 原文：https://huggingface.co/blog/continuous_async

## 摘要

Hugging Face 发现，一个 80 亿参数的模型在生成 8000 个 token 时，GPU 有 24% 的时间在空转。原因出在同步批处理上：CPU 准备下一批数据时，GPU 只能干等，反之亦然。这篇文章讲的是怎么用 CUDA 流把这两件事拆开并行，让 CPU 准备第 N+1 批的同时，GPU 已经在算第 N 批，把空闲缝隙填满。

## 推荐理由

我会先打个折：这不是新模型发布，是推理系统的工程优化。Hugging Face 给了一个具体的 24% GPU 空闲率，并解释了用 CUDA 流重叠 CPU 与 GPU 工作的机制，对跑线上服务的团队有参考价值，但属于底层技巧而非行业大新闻，所以放在低 featured 档。

## 锐评

这篇文章讲的是怎么把推理服务里 CPU 和 GPU 的“轮流休息”改成“同时干活”。他们拿一个 80 亿参数的模型做测试，生成 8000 个 token 时，GPU 有 24% 的时间是闲着的。原因很简单：同步批处理下，CPU 准备下一批数据时 GPU 只能干等，反过来也一样。文章给出的解法是用 CUDA 流把这两件事拆开，让 CPU 准备第 N+1 批的同时，GPU 已经在算第 N 批。

这个思路不新鲜，但文章把实现细节讲得比较清楚，包括怎么用 CUDA 事件来强制同步、怎么处理竞争条件和 carry-over 这些坑。不过正文没给出优化后的具体吞吐提升数字，也没提不同模型规模下的收益差异。这点先别太激动，24% 的空闲是特定场景下的测量值，换个小模型或者短文本，收益可能没那么大。另外，异步引入的复杂度会不会在工程上带来新的稳定性问题，文章也没展开。
