跳到正文
原文
vLLM 官方博客(RSS)· Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin·· 16 天前精选AI 评分74

vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务

Announcing vllm-metal: Concurrent Serving on Apple Silicon

AI 导读

vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。

推荐理由

官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。

整理与数据来源:AIHOT

来源:vLLM 官方博客(RSS) · vllm.ai