↑: [[G検定に関する知識]] - Q学習と同様に行動価値関数Qを学習する手法 - オンポリシー:Q更新時に実際に次に取る行動を使う(動く方策=学ぶ方策) - Q学習との唯一の違いは「次の行動の仮定」:Q学習は最良行動、SARSAは実際の行動 - 「Q学習=オフポリシー、SARSA=オンポリシー」の対比が最頻出 - cf. [[Q学習]] [[価値関数]] [[強化学習]]