vLLM 官方博客(RSS)· Wentao Ye, Canlin Guo, Yongye Zhu, Jiangyun Zhu, Ziming Huang, Wei Zhao, Michael Goin, Jie Li·· 25 天前AI 评分53
vLLM 优化 Kimi K3 服务性能:吞吐提升 2.2–2.8 倍
Kimi K3 Performance Optimizations in vLLM: The Road to 2.8× Throughput
AI 导读
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
整理与数据来源:AIHOT
来源:vLLM 官方博客(RSS) · vllm.ai