# vLLM 发布 vllm-metal v0.28.0：让苹果芯片能同时处理多个 AI 请求

> 原标题：vLLM 发布 vllm-metal v0.28.0：在 Apple Silicon 上支持并发推理服务

- 来源：AI HOT 精选
- 发布时间：2026-09-22T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58418
- 原文：https://vllm.ai/blog/2026-09-22-vllm-metal-v0-28-0

## 摘要

vllm-metal 把 vLLM 的任务调度、分页键值缓存和 OpenAI 兼容接口搬到了苹果芯片上，解决了本地跑模型时多个请求并发导致的响应慢和内存暴涨问题。它复用了 mlx_lm 的模型层，但把注意力计算换成了自定义的 Metal 内核。v0.28.0 版本号跟上游 vLLM 对齐，新增了批量多令牌预测、GGUF 和混合模型支持，并在 M5 芯片...

## 推荐理由

vLLM 把成熟的推理服务栈移植到 Apple Silicon，解决了本地并发这个真实痛点，并附带了具体技术细节和性能数字。不是新模型发布，影响范围限于 Mac 生态，所以分数维持在 78。

## 锐评

这条消息对用 Mac 跑本地模型的人来说很实用。以前在苹果芯片上跑模型，单次对话还行，一旦多个请求同时进来，首字延迟会飙升，内存也容易失控。vllm-metal 把 vLLM 成熟的任务调度和分页键值缓存（Paged KV Cache）机制搬了过来，相当于给本地模型装了个交通指挥系统，能同时处理多个请求而不崩。

它聪明地复用了 mlx_lm 的模型层，只把注意力计算换成了自研的 Metal 内核，改动很小。v0.28.0 版本号跟上游对齐，新增了批量多令牌预测和 GGUF 格式支持，在 M5 芯片上预填充速度也更快。安装走 Homebrew，启动后直接提供 OpenAI 兼容接口，Claude Code 这类工具能直接连上用。

不过文章主要在讲架构和功能，没给出具体的并发性能对比数据，比如在 M4 Max 上同时跑 10 个请求，延迟和吞吐到底改善了多少。这点先别太激动，等实测数据出来再说。另外，它依赖 macOS 15 以上系统，老版本用户暂时用不了。
