跳到正文
热点事件历史事件

vLLM 发布 vllm-metal v0.28.0:让苹果芯片能同时处理多个 AI 请求

1 篇报道1 个报道来源6 天前更新

先了解这件事

事实说明

vllm-metal 把 vLLM 的任务调度、分页键值缓存和 OpenAI 兼容接口搬到了苹果芯片上,解决了本地跑模型时多个请求并发导致的响应慢和内存暴涨问题。它复用了 mlx_lm 的模型层,但把注意力计算换成了自定义的 Metal 内核。v0.28.0 版本号跟上游 vLLM 对齐,新增了批量多令牌预测、GGUF 和混合模型支持,并在 M5 芯片...

报道时间线

沿着报道,了解事件的不同侧面。

9月22日
  1. AI HOT 精选精选
    vLLM 发布 vllm-metal v0.28.0:让苹果芯片能同时处理多个 AI 请求

    vllm-metal 把 vLLM 的任务调度、分页键值缓存和 OpenAI 兼容接口搬到了苹果芯片上,解决了本地跑模型时多个请求并发导致的响应慢和内存暴涨问题。它复用了 mlx_lm 的模型层,但把注意力计算换成了自定义的 Metal 内核。v0.28.0 版本号跟上游 vLLM 对齐,新增了批量多令牌预测、GGUF 和混合模型支持,并在 M5 芯片...