↑: [[G検定に関する知識]] - エピソードが終了してから得られた累積報酬を使って学習するアプローチ - 強化学習の文脈では[[REINFORCE]]がこれに基づく - **エピソード全体を使って一括更新**する - [[TD学習]]との対比 - モンテカルロ法:エピソード終了後に一括更新 - TD学習:1ステップごとにTD誤差で逐次更新