↑: [[G検定に関する知識]] - 自然言語処理モデルの性能を測る総合ベンチマーク(2018年) - 9つのタスク(感情分析・含意判定・言い換え・文の類似・質問応答・文法判定・共参照・推論・対話)の総合スコア - BERTがここで高得点を出しNLPの標準指標となった - SuperGLUEはGLUEより難しい上位版 - cf. [[BERT]], [[GPT]], [[自然言語処理]]