↑: [[G検定に関する知識]] - DQNの改良版:行動を選ぶネットワークと価値を評価するネットワークを分離 - Q値の過大評価を抑えることで学習を安定化 - cf. [[DQN-G検定]], [[Rainbow]], [[深層強化学習]]