↑: [[G検定に関する知識]] - 画像を入力として文章(説明文)を生成するタスク - マルチモーダルAIの3大タスクの1つ - 入力:画像、出力:テキスト - cf. [[マルチモーダル]], [[VQA]]