↑: [[G検定に関する知識]] - 複数種類のデータ(画像・文章・音声など)を同時に扱うAIの手法 - モダリティ(modality)= データの種類(画像、テキスト、音声など) - 代表的な3大タスク:①イメージ・キャプショニング ②テキスト・トゥ・イメージ ③VQA - cf. [[CLIP]], [[DALL-E]], [[Flamingo]], [[Unified-IO]], [[基盤モデル]]