↑: [[G検定に関する知識]] - 画像・テキスト・音声など複数種類のデータ(モダリティ)を組み合わせて処理するAI - 主要タスク - **Image Captioning**:画像→テキスト(画像の説明文を生成) - **[[VQA]]**:画像+テキスト質問→テキスト回答 - **Text-to-Image**:テキスト→画像(Stable Diffusion・DALL-Eなど)