SemiAnalysis· @SemiAnalysis_ · X·· 15 天前AI 评分55
AI 导读
vLLM 维护者展示 TPUv7 经 megakernel 优化后在 Kimi K3 上达到 700 tok/s/user,比 NVIDIA GB200 NVL72 高 56%。图表显示 16× TPU v7 为 709 tokens/s,16× GB200 vLLM baseline 为 452 tokens/s。SemiAnalysis 称 TPU 软件外部化进展值得持续关注。
整理与数据来源:AIHOT
来源:SemiAnalysis · x.com