↑: [[G検定に関する知識]] - 価値ベース(Q学習系)と方策ベース(方策勾配法)を組み合わせたハイブリッド手法 - アクター:方策に従って行動を選ぶ / クリティック:その行動を評価する - クリティックがTD誤差を計算し、アクターの方策を改善していく - 現代の深層強化学習A3C・PPOはすべてこの発展形 - cf. [[方策勾配法-G検定]] [[Q学習]] [[強化学習]]