vLLM Hybrid HiSparse 源码实现分析:KV Cache 内存管理深入拆解
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
钱塘江上潮信来,今日方知我是我
版本说明:Hybrid HiSparse 在 vLLM 官方博客(2026-09-08)发布时尚在 hisparse-glm 分支(基准 commit e8ef1e07bd),现已合入 v0.30.0rc2(commit fa6ff0606)。本文基于 v0.30.0rc2 的源码(GitHub ...
来源: vLLM 官方博客(2026-09-08) 原文: GLM 5.3 Optimizations, Part 1: Hybrid HiSparse Offloading in vLLM 相关阅读: 本博同日翻译的 vLLM HiSparse 设计文档(附 SGLang 对照)正是这套机制的详...
来源: vLLM 官方设计文档(developer preview / latest,2026-09-12 更新);文末附 LMSYS Blog 的 SGLang HiSparse 博文(2026-04-10)作为延伸对照 原文: HiSparse local KV offload archite...
作者: Aleksa Gordić 原文: Inside the Transformer: The Life of a Token 在这篇文章中,我将深入剖析一个现代稠密 Transformer [1] 的内部实现。我只关注单张 GPU 上的前向传播——就当我们要执行一次训练步——而忽略反向传播...