跳到正文
张逸骅
文章
随记
EN
中
◐
文章
全部
13
后训练
6
系统
5
音乐
2
旧文
20
系列
3
解剖 DeepSeek
3
GRPO 的谱系
13 篇文章
2026-02-13
《Vogel im Käfig》音乐解构:泽野弘之如何用最小的音程构造希望与绝望
音乐
·
zh
Sawano
2025-10-02
AI Infra 的角色转变:从辅助转为主力输出
AI Market Insights
系统
·
en
2025-08-08
GRPO 的进化之路:从 GRPO 走向 DAPO 和 GSPO
后训练
·
en / zh
·
17 个公式
GRPO 的谱系 2
GRPO
2025-07-02
从 RL for LLM 视角重新理解 KL 估计:读《Approximating KL Divergence》笔记
后训练
·
en / zh
·
18 个公式
GRPO 的谱系 3
GRPO
2025-04-10
机器学习中的装饰器
系统
·
en / zh
Python
2025-03-08
《Bauklötze》音乐解构
积木崩塌时的命运回响,泽野弘之用音符砌筑的巨人悲歌
音乐
·
zh
Sawano
2025-02-27
DualPipe 深入浅出:没有分布式训练基础也能看懂的 DualPipe 全方位讲解
系统
·
en / zh
解剖 DeepSeek 3
Distributed
2025-02-11
大语言模型 RLHF 全链路揭秘:从策略梯度、PPO、GAE 到 DPO 的实战指南
后训练
·
en / zh
·
93 个公式
RLHF
2025-02-07
DeepSeek-R1 技术剖析:没有强化学习基础也能看懂的 PPO & GRPO
后训练
·
en / zh
·
16 个公式
GRPO 的谱系 1
GRPO
RLHF
2025-02-02
从多头共享到潜变量:DeepSeek的MLA在低秩投影与按需解压中重新定义 KV-Cache
系统
·
en / zh
·
24 个公式
解剖 DeepSeek 2
KV-Cache
2025-01-20
千呼万唤始出来:DeepSeek-R1 如何通过强化学习实现复杂推理
后训练
·
en / zh
·
2 个公式
解剖 DeepSeek 1
GRPO
2025-01-15
关于 MoE 大模型负载均衡策略演进的回顾:坑点与经验教训
系统
·
en / zh
·
17 个公式
MoE
2024-12-15
给大模型打打补丁:机器反学习方法中的陷阱与痛点
后训练
·
en / zh
·
14 个公式
Unlearning