↑: [[G検定に関する知識]] - 強化学習において「状態sで行動aをとることの価値」を表す関数:Q(s, a) - 「状態と行動の組み合わせ」を評価する([[V関数]]は状態のみ) - [[DQN]](Deep Q-Network)はQ関数をニューラルネットワークで近似する手法 - ε-greedy法:確率εでランダム行動(探索)、それ以外でQ値最大の行動(活用) - Bellman方程式で更新:現在のQ値を次の状態のQ値で更新 - cf. [[V関数]](状態価値関数)