↑: [[G検定に関する知識]] - 方策(Actor)と価値関数(Critic)を同時に学習する強化学習手法 - **[[TD誤差]]**を使って逐次更新する - [[REINFORCE]](モンテカルロ法)と対比される