深色模式
Download exercise.py
补全 puct_score:PUCT=Q+c⋅P⋅Nparent/(1+Nchild)。未访问边(N=0)应只靠探索项,同样先验下比已访问边更高。
puct_score
cd docs/nn-decision/rl/alphago/code python exercise.py
clone 后打开(相对仓库根目录):
docs/nn-decision/rl/alphago/code/exercise.py