Skip to content

PPO:近端策略优化 — 练习

Download exercise.py

两处 TODO:clipped_surrogate(正文 LCLIP)和 compute_gae(从后往前累加 δt)。λ=1 时应得到 Monte Carlo 回报;λ=0 应退回单步 TD。

bash
cd docs/nn-decision/rl/ppo/code
python exercise.py

源码位置

clone 后打开(相对仓库根目录):

docs/nn-decision/rl/ppo/code/exercise.py