↑: [[G検定に関する知識]]
- 「正解」ではなく「報酬」を手がかりに、エージェントが試行錯誤しながら行動を学ぶ手法
- ループ:エージェントが行動 → 環境から状態・報酬を受け取る → 報酬の合計を最大化
- 方策(policy)=状態から行動への対応関係
- 向いている問題:正解は不明だがゴールが明確・連続した意思決定・何度も試せる環境
- 応用:囲碁・将棋(AlphaGo)、ロボット制御、自動運転、対話AI(RLHF)
- cf. [[マルコフ決定過程-G検定]] [[Q学習]] [[SARSA]] [[アクター・クリティック]] [[RLHF]]