vLLM Hybrid HiSparse 源码实现分析:KV Cache 内存管理深入拆解
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
来源: vLLM 官方博客(2026-09-08) 原文: GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM 相关阅读: 本博同日翻译的 vLLM HiSparse 设计文档(附 SGLang 对照)正是这套机制的详...
来源: vLLM 官方设计文档(developer preview / latest,2026-09-12 更新);文末附 LMSYS Blog 的 SGLang HiSparse 博文(2026-04-10)作为延伸对照 原文: HiSparse local KV offload archite...
HiCache 是 SGLang 把 RadixAttention 从”GPU 显存内的前缀复用”扩展到”GPU + 主机内存 + 分布式存储”三级缓存的实现。本文不复述官方设计文档的结论,而是直接拆代码,回答三个问题: 三级缓存各自的数据结构和生命周期是什么; 每一层的替换(驱逐)策略是什么,层...
本文覆盖推理场景的 7 种并行策略:TP、PP、DP、EP、DP Attention、SP、CP。 按切分维度分为四组: Weight(参数维度):TP、EP Batch(样本维度):DP、DP Attention Sequence / Context(序列维度):SP、CP Layer(深度维度)...
项目概述ContextPilot 是一个专注于长上下文 LLM 推理加速的开源项目,已被 MLSys 2026 接收。其核心思想是通过上下文复用(Context Reuse)来加速预填充(prefill)阶段,同时保持推理质量。 核心指标 指标 提升效果 缓存命中率 4–12× 提升 ...