↑: [[G検定に関する知識]] - 強化学習を数学的に表す枠組み。前提はマルコフ性 - 4つの要素:状態(S)・行動(A)・遷移確率・即時報酬 - Q学習・SARSA・方策勾配法など、ほぼすべての強化学習手法がこの枠組みで定式化される - cf. [[強化学習]] [[マルコフ性-G検定]] [[割引率]]