深色模式
Download exercise.py
两处 TODO:clipped_surrogate(正文 LCLIP)和 compute_gae(从后往前累加 δt)。λ=1 时应得到 Monte Carlo 回报;λ=0 应退回单步 TD。
clipped_surrogate
compute_gae
cd docs/nn-decision/rl/ppo/code python exercise.py
clone 后打开(相对仓库根目录):
docs/nn-decision/rl/ppo/code/exercise.py