跳到正文
张逸骅
文章
随记
EN
中
◐
全部
GRPO
4 篇文章
2025-08-08
GRPO 的进化之路:从 GRPO 走向 DAPO 和 GSPO
后训练
·
en / zh
·
17 个公式
GRPO 的谱系 2
GRPO
2025-07-02
从 RL for LLM 视角重新理解 KL 估计:读《Approximating KL Divergence》笔记
后训练
·
en / zh
·
18 个公式
GRPO 的谱系 3
GRPO
2025-02-07
DeepSeek-R1 技术剖析:没有强化学习基础也能看懂的 PPO & GRPO
后训练
·
en / zh
·
16 个公式
GRPO 的谱系 1
GRPO
RLHF
2025-01-20
千呼万唤始出来:DeepSeek-R1 如何通过强化学习实现复杂推理
后训练
·
en / zh
·
2 个公式
解剖 DeepSeek 1
GRPO