↑: [[G検定に関する知識]] - 方策そのものを直接学習する方策ベースの手法(価値関数を介さない) - うまくいった行動の確率を上げ、ダメだった行動の確率を下げる - 連続的な行動(自動運転のハンドル角度など)に対応できる - 代表手法:REINFORCE - cf. [[REINFORCE-G検定]] [[アクター・クリティック]] [[強化学習]]