FreeToken hybrid MoE 后端:带宽比如何决定专家「搬」还是「算」
目标:讲清楚 FreeToken(FlashML 的开源边端 MoE 推理引擎)里「带宽比」这一核心概念的来龙去脉——它如何从硬件实测出发,决定 hybrid 后端每一步里哪些专家走 PCIe 搬上 GPU、哪些留在 CPU 直接算,最终让 PCIe 搬运与 CPU 计算刚好同时结束,实现完美 o...
目标:讲清楚 FreeToken(FlashML 的开源边端 MoE 推理引擎)里「带宽比」这一核心概念的来龙去脉——它如何从硬件实测出发,决定 hybrid 后端每一步里哪些专家走 PCIe 搬上 GPU、哪些留在 CPU 直接算,最终让 PCIe 搬运与 CPU 计算刚好同时结束,实现完美 o...
DeepSeek-V4 论文逐页注解巡读 作者: Igor Kotenkov 原文: DeepSeek-V4: Annotated Paper Walkthrough 本文档包含 50 条注解,涵盖 DeepSeek-V4 论文的核心技术要点。注解类型包括:规模笔记、架构笔记、硬件笔记、训练笔记、...
DeepSeek-AI research@deepseek.com 论文原文:DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence 模型权重:https://huggingface.co/collectio...