跳到正文
AI HOT 精选

vLLM 发布 vllm-metal v0.28.0:让苹果芯片能同时处理多个 AI 请求

vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务

vllm-metal 把 vLLM 的任务调度、分页键值缓存和 OpenAI 兼容接口搬到了苹果芯片上,解决了本地跑模型时多个请求并发导致的响应慢和内存暴涨问题。它复用了 mlx_lm 的模型层,但把注意力计算换成了自定义的 Metal 内核。v0.28.0 版本号跟上游 vLLM 对齐,新增了批量多令牌预测、GGUF 和混合模型支持,并在 M5 芯片...

推荐理由:vLLM 把成熟的推理服务栈移植到 Apple Silicon,解决了本地并发这个真实痛点,并附带了具体技术细节和性能数字。不是新模型发布,影响范围限于 Mac 生态,所以分数维持在 78。

读原文 ↗导出 Markdown