深色模式
Download exercise.py
group_advantages 做组内 z-score,全相同则返回 0;grpo_clipped_objective 与 PPO 练习 是同一套 min + clip,只是一条输出的所有 token 共用同一个 A^i。
group_advantages
grpo_clipped_objective
cd docs/nn-decision/rl/grpo/code python exercise.py
clone 后打开(相对仓库根目录):
docs/nn-decision/rl/grpo/code/exercise.py