↑: [[G検定に関する知識]] - 期待報酬に不確実性ボーナスを足して選択肢を評価する探索戦略 - 試した回数が少ない選択肢ほどボーナスが大きくなる(不確かなものを優先して試す) - 序盤:未試の選択肢を順に試す / 後半:有望なものに集中 - ε-greedyよりランダム性が少なく無駄な試行が少ない - cf. [[バンディット問題]] [[ε-greedy方策]]