vLLM 官方博客(RSS)· vLLM Team·· 2026-09-08AI 评分54
vLLM 推出 Hybrid HiSparse 优化,让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文
GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM
AI 导读
vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。
整理与数据来源:AIHOT
来源:vLLM 官方博客(RSS) · vllm.ai