↑: [[G検定に関する知識]] - 画像(視覚情報)+質問テキストを入力し、画像内容に基づいてテキストで回答する[[マルチモーダルAI]]タスク - 例:冷蔵庫の写真+「牛乳はどこ?」→「上段右側」 - 画像分類とは異なる(質問文の理解が必須) - 画像生成モデルではない(出力はテキスト)