跳到正文
张逸骅
文章
随记
EN
中
◐
全部
RLHF
2 篇文章
2025-02-11
大语言模型 RLHF 全链路揭秘:从策略梯度、PPO、GAE 到 DPO 的实战指南
后训练
·
en / zh
·
93 个公式
RLHF
2025-02-07
DeepSeek-R1 技术剖析:没有强化学习基础也能看懂的 PPO & GRPO
后训练
·
en / zh
·
16 个公式
GRPO 的谱系 1
GRPO
RLHF