↑: [[G検定に関する知識]] - 行動価値関数Q(状態×行動ごとの将来報酬の予想値)を学習する価値ベースの代表手法 - オフポリシー:動いている方策と学習している方策が別でよい(Q更新時に次の最良行動を仮定) - 深層化したものがDQN(ディープQネットワーク) - 「Q学習=オフポリシー」は試験頻出キーワード - cf. [[SARSA]] [[DQN]] [[価値関数]] [[強化学習]]