热点事件历史事件
vLLM 发布 vllm-metal v0.28.0:让苹果芯片能同时处理多个 AI 请求
1 篇报道1 个报道来源6 天前更新
先了解这件事
事实说明
vllm-metal 把 vLLM 的任务调度、分页键值缓存和 OpenAI 兼容接口搬到了苹果芯片上,解决了本地跑模型时多个请求并发导致的响应慢和内存暴涨问题。它复用了 mlx_lm 的模型层,但把注意力计算换成了自定义的 Metal 内核。v0.28.0 版本号跟上游 vLLM 对齐,新增了批量多令牌预测、GGUF 和混合模型支持,并在 M5 芯片...
报道时间线
沿着报道,了解事件的不同侧面。
9月22日
- AI HOT 精选精选vLLM 发布 vllm-metal v0.28.0:让苹果芯片能同时处理多个 AI 请求
vllm-metal 把 vLLM 的任务调度、分页键值缓存和 OpenAI 兼容接口搬到了苹果芯片上,解决了本地跑模型时多个请求并发导致的响应慢和内存暴涨问题。它复用了 mlx_lm 的模型层,但把注意力计算换成了自定义的 Metal 内核。v0.28.0 版本号跟上游 vLLM 对齐,新增了批量多令牌预测、GGUF 和混合模型支持,并在 M5 芯片...