SGLang HiCache 多级 KV 缓存实现剖析:分层结构、替换策略与异构 Attention 适配
HiCache 是 SGLang 把 RadixAttention 从”GPU 显存内的前缀复用”扩展到”GPU + 主机内存 + 分布式存储”三级缓存的实现。本文不复述官方设计文档的结论,而是直接拆代码,回答三个问题: 三级缓存各自的数据结构和生命周期是什么; 每一层的替换(驱逐)策略是什么,层...
钱塘江上潮信来,今日方知我是我
HiCache 是 SGLang 把 RadixAttention 从”GPU 显存内的前缀复用”扩展到”GPU + 主机内存 + 分布式存储”三级缓存的实现。本文不复述官方设计文档的结论,而是直接拆代码,回答三个问题: 三级缓存各自的数据结构和生命周期是什么; 每一层的替换(驱逐)策略是什么,层...
目标:在一台 GEM12 迷你主机(RTX 3060,经 OCuLink/M.2 显卡坞扩展)上启用 NVIDIA GPUDirect Storage(cuFile / nvidia-fs),让 NVMe SSD 直接 DMA 到 GPU 显存,绕开 CPU 中转。 结论先说:GeForce 上 ...
目标:讲清楚 FreeToken(FlashML 的开源边端 MoE 推理引擎)里「带宽比」这一核心概念的来龙去脉——它如何从硬件实测出发,决定 hybrid 后端每一步里哪些专家走 PCIe 搬上 GPU、哪些留在 CPU 直接算,最终让 PCIe 搬运与 CPU 计算刚好同时结束,实现完美 o...
说明:本文记录的是早期的「内核补丁」方案(改 open kernel module 源码 + 禁用 GSP 固件)。后续验证发现,GDS(GPU↔NVMe)其实不需要改内核模块,改用纯用户态拦截 RM ioctl 补建 NV503C 对象即可。最终验证通过的 userspace 方案见:《在 Ge...