FreeToken hybrid MoE 后端:带宽比如何决定专家「搬」还是「算」
目标:讲清楚 FreeToken(FlashML 的开源边端 MoE 推理引擎)里「带宽比」这一核心概念的来龙去脉——它如何从硬件实测出发,决定 hybrid 后端每一步里哪些专家走 PCIe 搬上 GPU、哪些留在 CPU 直接算,最终让 PCIe 搬运与 CPU 计算刚好同时结束,实现完美 o...
目标:讲清楚 FreeToken(FlashML 的开源边端 MoE 推理引擎)里「带宽比」这一核心概念的来龙去脉——它如何从硬件实测出发,决定 hybrid 后端每一步里哪些专家走 PCIe 搬上 GPU、哪些留在 CPU 直接算,最终让 PCIe 搬运与 CPU 计算刚好同时结束,实现完美 o...