Tag: rl
All the articles with the tag "rl".
OPD 深度解析(三):知识蒸馏与 OPD 梯度推导
从离线知识蒸馏到 on-policy distillation 的梯度推导,涵盖 sequence-level 与 token-level OPD
OPD 深度解析(一):概率、熵与 KL 散度
从概率分布到熵、交叉熵再到 KL 散度,建立 on-policy distillation 的数学基础
OPD 深度解析(二):SFT 与策略梯度推导
从自回归分解到 SFT loss 再到策略梯度,为 on-policy distillation 推导打下数学基础