↑: [[G検定に関する知識]] - 強化学習において「状態sにいることの価値」を表す関数:V(s) - 「行動」ではなく「状態」のみを評価する点が[[Q関数]]との違い - 計算:その状態からスタートして将来得られる期待割引報酬の合計 - 現在の方策(行動ルール)に依存する - 例(将棋): - V値が高い → 王将を追い詰めた盤面(勝利が見えている) - V値が低い → 重要な駒を取られた盤面(負けそう) - cf. [[Q関数]](状態と行動の組み合わせで価値を評価)