↑: [[G検定に関する知識]] - 「正解」ではなく「報酬」を手がかりに、エージェントが試行錯誤しながら行動を学ぶ手法 - ループ:エージェントが行動 → 環境から状態・報酬を受け取る → 報酬の合計を最大化 - 方策(policy)=状態から行動への対応関係 - 向いている問題:正解は不明だがゴールが明確・連続した意思決定・何度も試せる環境 - 応用:囲碁・将棋(AlphaGo)、ロボット制御、自動運転、対話AI(RLHF) - cf. [[マルコフ決定過程-G検定]] [[Q学習]] [[SARSA]] [[アクター・クリティック]] [[RLHF]]