↑: [[G検定に関する知識]] - Proximal Policy Optimization(近位方策最適化) - 方策の更新幅を制限することで学習を安定化 - 動かしすぎると方策が壊れるという問題を解決 - 実務・研究の現代標準、RLHFにも使用される - cf. [[A3C]], [[RLHF-G検定]], [[深層強化学習]]