↑: [[G検定に関する知識]] - 1ステップごとの予測のズレを使って逐次更新する強化学習の手法 - [[強化学習]]における「予測した価値」と「1ステップ後の実結果+次の予測価値」のズレ - **予測と実際のズレを表す**(学習シグナルの中核) - **価値関数の更新に使う** ← 使わないは誤り - **報酬を使って計算する** ← 報酬なしでは計算できない - 学習初期はTD誤差が大きく、学習が進むにつれてゼロに近づく(常に0でなければならないは誤り) - 人間の「思ったより良かった・悪かった」という経験学習を数式化したもの - **[[REINFORCE]]はTD誤差を使わない**(モンテカルロ法ベース) - [[Actor-Critic]]などで使われる - モンテカルロ法との対比 - TD誤差:途中途中で逐次更新・エピソード完了不要 - モンテカルロ法:エピソード終了後に一括更新