vLLM 官方博客(RSS)· Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin·· 16 天前精选AI 评分74
vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务
Announcing vllm-metal: Concurrent Serving on Apple Silicon
AI 导读
vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。
推荐理由
官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。
整理与数据来源:AIHOT
来源:vLLM 官方博客(RSS) · vllm.ai