深入 Transformer 内部:一个 Token 的一生
作者: Aleksa Gordić 原文: Inside the Transformer: The Life of a Token 在这篇文章中,我将深入剖析一个现代稠密 Transformer [1] 的内部实现。我只关注单张 GPU 上的前向传播——就当我们要执行一次训练步——而忽略反向传播...
作者: Aleksa Gordić 原文: Inside the Transformer: The Life of a Token 在这篇文章中,我将深入剖析一个现代稠密 Transformer [1] 的内部实现。我只关注单张 GPU 上的前向传播——就当我们要执行一次训练步——而忽略反向传播...
原文: State of RL for reasoning LLMs by aweers 翻译说明: 本文翻译自 aweers 的技术博客,系统梳理了 2024-2026 年间推理 LLM 强化学习领域的重大发展。文章从基础算法(REINFORCE、PPO)讲起,逐步深入到 GRPO 及后续改进方...