↑: [[G検定に関する知識]] - 強化学習にディープラーニングを組み合わせたもの - 画像のような複雑な状態を入力として扱えるようになった - 出発点はDeepMindのDQN(2013年)、AlphaGoやChatGPTのRLHFもこの分野から - cf. [[DQN-G検定]], [[RLHF-G検定]], [[A3C]], [[PPO]]