Posts
All the articles I've posted.
从 PPO 到 GRPO:LLM 强化学习的原理与 PyTorch 实现
从策略梯度到 GRPO 完整实现,再到 grad_fn、AdamW 与训练显存全景的逐层拆解
GLM-5.3 系统优化深度解读:slime 框架如何支撑长周期 RL 扩展
从 OPD 蒸馏到 TensorBackuper 权重快照、路由调度与数值对齐,基于 slime 源码拆解 GLM-5.3 长周期 RL 训练的系统优化
eLLM:用算力换显存的自适应 KV Cache
EuroSys'26 论文解读:通过 token 粒度+层粒度的部分 KV Cache 重算和横向核融合,用富余算力换取紧缺显存
OPD 深度解析(三):知识蒸馏与 OPD 梯度推导
从离线知识蒸馏到 on-policy distillation 的梯度推导,涵盖 sequence-level 与 token-level OPD