↑: [[G検定に関する知識]] - CNNを使わずTransformerで画像認識を行うモデル(Google, 2020) - 画像を16×16ピクセルのパッチに分割し、各パッチをトークンとしてTransformerに入力 - 大量データで学習させるとCNNを上回る性能を発揮。現代の主流のひとつ - 少データではCNNに劣る(局所的な帰納バイアスがないため) - cf. [[Transformer]], [[Self-Attention]], [[ResNet]]