↑: [[G検定に関する知識]] - モデルの重みの数値精度を落としてサイズと計算量を削る手法 - 代表例:32bit浮動小数点 → 8bit整数でサイズが1/4になる - 整数計算は端末チップが得意なので、端末での推論が高速化する - 2種類:PTQ(学習後量子化・後から粗くする)とQAT(量子化を意識した学習・精度は高いが学習し直しが要る) - cf. [[プルーニング]], [[知識蒸留]], [[モデルの軽量化]]