vLLM Hybrid HiSparse 源码实现分析:KV Cache 内存管理深入拆解
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
来源: vLLM 官方设计文档(developer preview / latest,2026-09-12 更新);文末附 LMSYS Blog 的 SGLang HiSparse 博文(2026-04-10)作为延伸对照 原文: HiSparse local KV offload archite...
HiCache 是 SGLang 把 RadixAttention 从”GPU 显存内的前缀复用”扩展到”GPU + 主机内存 + 分布式存储”三级缓存的实现。本文不复述官方设计文档的结论,而是直接拆代码,回答三个问题: 三级缓存各自的数据结构和生命周期是什么; 每一层的替换(驱逐)策略是什么,层...