↑: [[G検定に関する知識]]
- 強化学習において「方策(行動確率分布)」そのものを直接最適化する手法
- 価値関数([[Q関数]]・[[V関数]])を介さずに方策のパラメータを勾配で更新
- 連続行動空間や行動数が膨大な場合に強みを発揮(ロボット制御・自動運転)
- 代表的アルゴリズム
- REINFORCE:最もシンプルな方策勾配法
- Actor-Critic:方策勾配 + 価値関数のハイブリッド
- PPO(Proximal Policy Optimization):[[OpenAI Five]]で使用
- cf. [[DQN]](価値ベース手法)