↑: [[G検定に関する知識]] - Visual Question Answering:画像に対して自然言語で質問し、自然言語で回答するタスク - マルチモーダルAIの3大タスクの1つ - 入力:画像+質問文、出力:回答文 - 画像理解と言語理解の両方が必要 - cf. [[マルチモーダル]], [[イメージ・キャプショニング]]