↑: [[G検定に関する知識]] - 強化学習の基本的な**方策勾配法**アルゴリズム - [[モンテカルロ法]]に基づく:エピソード全体が終了してから累積報酬で学習 - 価値関数を使わない(方策を直接更新する) - エピソード全体を使って一括更新する - [[TD誤差]]を使わない(TD誤差を使うのはActor-Criticなど) - TD誤差との対比 - REINFORCE:エピソード終了後に一括更新(モンテカルロ) - Actor-Critic:1ステップごとに逐次更新(TD誤差)