跳到正文
原文
vLLM 官方博客(RSS)· Wentao Ye, Canlin Guo, Yongye Zhu, Jiangyun Zhu, Ziming Huang, Wei Zhao, Michael Goin, Jie Li·· 25 天前AI 评分53

vLLM 优化 Kimi K3 服务性能:吞吐提升 2.2–2.8 倍

Kimi K3 Performance Optimizations in vLLM: The Road to 2.8× Throughput

AI 导读

vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。

整理与数据来源:AIHOT

来源:vLLM 官方博客(RSS) · vllm.ai