↑: [[G検定に関する知識]]
- 1ステップごとの予測のズレを使って逐次更新する強化学習の手法
- [[強化学習]]における「予測した価値」と「1ステップ後の実結果+次の予測価値」のズレ
- **予測と実際のズレを表す**(学習シグナルの中核)
- **価値関数の更新に使う** ← 使わないは誤り
- **報酬を使って計算する** ← 報酬なしでは計算できない
- 学習初期はTD誤差が大きく、学習が進むにつれてゼロに近づく(常に0でなければならないは誤り)
- 人間の「思ったより良かった・悪かった」という経験学習を数式化したもの
- **[[REINFORCE]]はTD誤差を使わない**(モンテカルロ法ベース)
- [[Actor-Critic]]などで使われる
- モンテカルロ法との対比
- TD誤差:途中途中で逐次更新・エピソード完了不要
- モンテカルロ法:エピソード終了後に一括更新