↑: [[G検定に関する知識]] - 精度を保ったまま、モデルのサイズと計算量を削る技術の総称 - 背景:GPT級・BERT級のモデルは数百MB〜数GB。スマホに載る目安は200MB程度 - 端末の制約:メモリ・計算力・電力・発熱に限りがある - 代表的な3手法:①量子化(数値を粗く)②プルーニング(おもみを削る)③知識蒸留(知識を移す) - cf. [[エッジAI]], [[量子化]], [[プルーニング]], [[知識蒸留]]