↑: [[G検定に関する知識]] - 2020年登場。[[CNN]]を使わない画像認識モデル - 画像を小さなパッチに分割→単語列のように処理 - **Self-Attention**で画像全体のつながりを一度に捉える - 「画像認識=CNN」という常識を覆した - [[SENet]]との違い:SENetはCNNベース、ViTはTransformerベース - [[CNN画像認識モデルの進化]]も参照