↑: [[【G検定2026年難化トレンド対応】模擬試験5回分(725問)〜本番で焦らないための問題集〜]]
- [[REINFORCE]]は[[強化学習]]における基本的な[[方策勾配法]]のアルゴリズム
- モンテカルロ法を使っている [[モンテカルロ法は数多く打って最良のものを選ぶ|Rrwx]]
- ゲームの開始から終了までの行動と結果を全て記録
- 得られた結果を用いて一括で更新する
- 結果を元に良かった行動の確率を上げて、悪かった行動の確率を下げる
- 一般的な[[REINFORCE]]は[[価値関数]]を学習・使用しない
- 得られた報酬を用いて[[方策]]を直接更新する純粋な[[方策勾配法]]を使っている
- 1ステップごとの予測ずれを使って逐次更新はしない
- [[REINFORCE]]はTD誤差は使わない
- 範囲: [[機械学習の概要]]