FreeToken hybrid MoE 后端:带宽比如何决定专家「搬」还是「算」
目标:讲清楚 FreeToken(FlashML 的开源边端 MoE 推理引擎)里「带宽比」这一核心概念的来龙去脉——它如何从硬件实测出发,决定 hybrid 后端每一步里哪些专家走 PCIe 搬上 GPU、哪些留在 CPU 直接算,最终让 PCIe 搬运与 CPU 计算刚好同时结束,实现完美 o...
钱塘江上潮信来,今日方知我是我
目标:讲清楚 FreeToken(FlashML 的开源边端 MoE 推理引擎)里「带宽比」这一核心概念的来龙去脉——它如何从硬件实测出发,决定 hybrid 后端每一步里哪些专家走 PCIe 搬上 GPU、哪些留在 CPU 直接算,最终让 PCIe 搬运与 CPU 计算刚好同时结束,实现完美 o...
目标:在一台 GEM12 迷你主机(RTX 3060,经 OCuLink/M.2 显卡坞扩展)上启用 NVIDIA GPUDirect Storage(cuFile / nvidia-fs),让 NVMe SSD 直接 DMA 到 GPU 显存,绕开 CPU 中转。最终实测 GDS 读带宽拉到 5...
来源:微信公众号「李迅雷金融与投资」,作者徐驰、张文宇(中泰策略) 原文:https://mp.weixin.qq.com/s/Zy5jI4H-W95tekfrsB0UDA 引言近期,科技股的波动明显放大,海外资本市场对”AI泡沫”的讨论持续升温,”AI-washing”(企业夸大或虚报自身AI...
引言Chiplet时代,Die-to-Die (D2D) 互连已经从一个学术课题变成了决定芯片系统能否成功的生命线。GPU要连HBM,CPU要连IO Die,逻辑Die要叠逻辑Die——每一对Die之间都有一条D2D link在默默搬运数据,而这条link的PPA(Performance, Powe...