↑: [[G検定に関する知識]] - DQNの改良版:ネットワーク出力を状態価値(V)と行動優位性(A)に分解 - 行動の良し悪し(Advantage)と状態の良し悪し(Value)を別々に学習 - cf. [[DQN-G検定]], [[Rainbow]], [[深層強化学習]]