↑: [[G検定に関する知識]] - Reinforcement Learning from Human Feedback - LLMの精度と安全性を高めるための強化学習手法 - 3ステップ:①候補を生成 → ②人間がランキング → ③報酬モデルを訓練して強化学習で更新 - ChatGPTの精度と安全性を支える中心技術、PPOを使用 - cf. [[PPO]], [[LLM]], [[深層強化学習]]