跳到正文
原文
vLLM 官方博客(RSS)· vLLM Team·· 2026-09-08AI 评分54

vLLM 推出 Hybrid HiSparse 优化,让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文

GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM

AI 导读

vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。

整理与数据来源:AIHOT

来源:vLLM 官方博客(RSS) · vllm.ai