跳到正文
张逸骅
文章
随记
EN
中
◐
后训练
全部
13
后训练
6
系统
5
音乐
2
旧文
20
系列
3
解剖 DeepSeek
3
GRPO 的谱系
6 篇文章
2025-08-08
GRPO 的进化之路:从 GRPO 走向 DAPO 和 GSPO
后训练
·
en / zh
·
17 个公式
GRPO 的谱系 2
GRPO
2025-07-02
从 RL for LLM 视角重新理解 KL 估计:读《Approximating KL Divergence》笔记
后训练
·
en / zh
·
18 个公式
GRPO 的谱系 3
GRPO
2025-02-11
大语言模型 RLHF 全链路揭秘:从策略梯度、PPO、GAE 到 DPO 的实战指南
后训练
·
en / zh
·
93 个公式
RLHF
2025-02-07
DeepSeek-R1 技术剖析:没有强化学习基础也能看懂的 PPO & GRPO
后训练
·
en / zh
·
16 个公式
GRPO 的谱系 1
GRPO
RLHF
2025-01-20
千呼万唤始出来:DeepSeek-R1 如何通过强化学习实现复杂推理
后训练
·
en / zh
·
2 个公式
解剖 DeepSeek 1
GRPO
2024-12-15
给大模型打打补丁:机器反学习方法中的陷阱与痛点
后训练
·
en / zh
·
14 个公式
Unlearning