↑: [[G検定に関する知識]] - [[Adam]]の収束の不安定さを解消した最適化アルゴリズム - 改良点:勾配の二乗の「過去の最大値」を保持し続ける(単調非減少) - 通常のAdamは新しい勾配を重視して過去の重要な「急斜面」を忘れる問題があった - AMSGradは学習率が不適切に跳ね上がるのを防ぎ、収束を理論保証 - [[AdaBound]]と組み合わせた発展形が[[AMSBound]]