Archives
All the articles I've archived.
20267
September1
从 PPO 到 GRPO:LLM 强化学习的原理与 PyTorch 实现
从策略梯度到 GRPO 完整实现,再到 grad_fn、AdamW 与训练显存全景的逐层拆解
August1
GLM-5.3 系统优化深度解读:slime 框架如何支撑长周期 RL 扩展
从 OPD 蒸馏到 TensorBackuper 权重快照、路由调度与数值对齐,基于 slime 源码拆解 GLM-5.3 长周期 RL 训练的系统优化
July5
eLLM:用算力换显存的自适应 KV Cache
EuroSys'26 论文解读:通过 token 粒度+层粒度的部分 KV Cache 重算和横向核融合,用富余算力换取紧缺显存
OPD 深度解析(三):知识蒸馏与 OPD 梯度推导
从离线知识蒸馏到 on-policy distillation 的梯度推导,涵盖 sequence-level 与 token-level OPD
OPD 深度解析(一):概率、熵与 KL 散度
从概率分布到熵、交叉熵再到 KL 散度,建立 on-policy distillation 的数学基础
OPD 深度解析(二):SFT 与策略梯度推导
从自回归分解到 SFT loss 再到策略梯度,为 on-policy distillation 推导打下数学基础
数学公式与代码高亮测试
验证 KaTeX 数学公式渲染和 Expressive Code 代码高亮(含复制按钮、终端帧、行号、diff、文本标记)。