← 返回标签列表

#SGLang

1 篇文章

SGLang HiCache 多级 KV 缓存实现剖析:分层结构、替换策略与异构 Attention 适配

HiCache 是 SGLang 把 RadixAttention 从”GPU 显存内的前缀复用”扩展到”GPU + 主机内存 + 分布式存储”三级缓存的实现。本文不复述官方设计文档的结论,而是直接拆代码,回答三个问题: 三级缓存各自的数据结构和生命周期是什么; 每一层的替换(驱逐)策略是什么,层...