↑: [[G検定に関する知識]] - 強化学習において「方策(行動確率分布)」そのものを直接最適化する手法 - 価値関数([[Q関数]]・[[V関数]])を介さずに方策のパラメータを勾配で更新 - 連続行動空間や行動数が膨大な場合に強みを発揮(ロボット制御・自動運転) - 代表的アルゴリズム - REINFORCE:最もシンプルな方策勾配法 - Actor-Critic:方策勾配 + 価値関数のハイブリッド - PPO(Proximal Policy Optimization):[[OpenAI Five]]で使用 - cf. [[DQN]](価値ベース手法)