↑: [[G検定に関する知識]] - 人間のフィードバックを報酬として使う強化学習の手法 - ChatGPTなどの大規模言語モデルの調整(人間の好みに沿った出力)に使われている - 人間が複数の出力を比較・評価し、その好みを報酬モデルとして学習する - cf. [[強化学習]] [[LLM]]