↑: [[G検定に関する知識]] - 大きくて高精度な「教師モデル」の知識を、小さな「生徒モデル」に移す手法 - 正解ラベルではなく、教師モデルの確率分布(ソフト・ターゲット)を真似るように学習させる - 代表例:DistilBERT(BERTから蒸留。4割小さく・6割速く・精度97%を維持) - cf. [[量子化]], [[プルーニング]], [[DistilBERT]], [[モデルの軽量化]]