↑: [[G検定に関する知識]] - Asynchronous Advantage Actor-Critic(非同期優位アクター・クリティック) - 方策ベースの深層強化学習手法 - 3つのA:Asynchronous(非同期並列)・Advantage(差分で学習)・Actor-Critic(方策と価値を両方学習) - cf. [[PPO]], [[深層強化学習]]