vLLM Hybrid HiSparse 源码实现分析:KV Cache 内存管理深入拆解
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
来源: vLLM 官方博客(2026-09-08) 原文: GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM 相关阅读: 本博同日翻译的 vLLM HiSparse 设计文档(附 SGLang 对照)正是这套机制的详...
来源: vLLM 官方设计文档(developer preview / latest,2026-09-12 更新);文末附 LMSYS Blog 的 SGLang HiSparse 博文(2026-04-10)作为延伸对照 原文: HiSparse local KV offload archite...
作者: Aleksa Gordić 原文: Inside the Transformer: The Life of a Token 在这篇文章中,我将深入剖析一个现代稠密 Transformer [1] 的内部实现。我只关注单张 GPU 上的前向传播——就当我们要执行一次训练步——而忽略反向传播...
HiCache 是 SGLang 把 RadixAttention 从”GPU 显存内的前缀复用”扩展到”GPU + 主机内存 + 分布式存储”三级缓存的实现。本文不复述官方设计文档的结论,而是直接拆代码,回答三个问题: 三级缓存各自的数据结构和生命周期是什么; 每一层的替换(驱逐)策略是什么,层...
项目概述ContextPilot 是一个专注于长上下文 LLM 推理加速的开源项目,已被 MLSys 2026 接收。其核心思想是通过上下文复用(Context Reuse)来加速预填充(prefill)阶段,同时保持推理质量。 核心指标 指标 提升效果 缓存命中率 4–12× 提升 ...