↑: [[G検定に関する知識]] - DeepMindが開発したマルチモーダル大規模言語モデル - 画像を見ながら会話できるモデル(チャットの流れに画像をそのまま挟める) - ChatGPTやGeminiの画像理解機能の先駆けとなったモデル - cf. [[マルチモーダル]], [[基盤モデル]], [[VQA]]