GLUE(General Language Understanding Evaluation)は、2018年にニューヨーク大学、ワシントン大学、およびDeepMindの研究者によって導入されたベンチマークスイートです。これは、多様な自然言語理解(NLU)タスクにおける機械学習モデルの評価と比較を目的として設計され、タスク固有のエンジニアリングなしで複数のタスクを処理できる汎用モデルの開発を促進することを目指していました。このベンチマークは、Artificial intelligenceおよび機械学習の分野、特に深層学習とニューラルネットワークの研究において、すぐに標準的な参照点となりました。
このベンチマークは、単文タスク、類似性および言い換えタスク、推論タスクの3つの主要なカテゴリをカバーする9つのタスクで構成されています。単文タスクには、文法的受容性をテストするCoLA(Corpus of Linguistic Acceptability)と、感情分析をテストするSST-2(Stanford Sentiment Treebank)が含まれます。類似性および言い換えタスクには、MRPC(Microsoft Research Paraphrase Corpus)、QQP(Quora Question Pairs)、およびSTS-B(Semantic Textual Similarity Benchmark)が含まれます。推論タスクには、MNLI(Multi-Genre Natural Language Inference)、QNLI(Question Natural Language Inference)、RTE(Recognizing Textual Entailment)、およびWNLI(Winograd Natural Language Inference)が含まれます。各タスクには、精度、F1スコア、またはピアソン相関などの独自の評価指標があり、全体的なGLUEスコアは、これらすべてのタスクにわたる指標の平均です。
歴史と動機
GLUEは、Alex Wang、Amanpreet Singh、Julian Michael、Felix Hill、Omer Levy、およびSamuel R. Bowmanによる2018年の論文「GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding」で導入されました。著者らは、既存のベンチマークはしばしば狭すぎて、モデルが特定のデータセットに過適合することを許していたと主張しました。GLUEは、構文、意味論、常識などの異なる種類の言語知識を必要とするタスクを含めることで、より包括的な評価を提供することを目指しました。このベンチマークには公開リーダーボードも含まれており、研究者がモデルを透明に比較できるようにしました。
GLUEの導入は、大規模言語モデルの急速な進歩の時期と一致しました。そのリリース直後、GoogleのBERT(Bidirectional Encoder Representations from Transformers)などのTransformer (architecture)アーキテクチャに基づくモデルがリーダーボードを支配し始めました。GLUEでのBERTの成功は、事前学習と微調整のパラダイムを普及させるのに役立ちました。このパラダイムでは、モデルが最初に大規模なテキストコーパスでトレーニングされ、その後特定のタスクに適応されます。このアプローチは、OpenAI、Anthropic、およびGoogle DeepMindなどの組織によって開発されたその後のモデルの基盤となりました。
タスクと評価
GLUEの9つのタスクは、難易度と言語現象の範囲をカバーするように選択されました。たとえば、CoLAは、モデルが文が文法的に受け入れ可能かどうかを判断することを要求し、構文知識をテストします。SST-2は、映画レビューからの二値感情分類を含みます。MRPCとQQPは言い換え検出タスクであり、モデルは2つの文が同じ意味を持つかどうかを判断する必要があります。STS-Bは、0から5のスケールで意味的類似性をスコアリングする回帰タスクです。
推論タスクについては、MNLIが最大であり、複数のジャンルにわたる40万以上の文ペアを含み、含意、矛盾、または中立を分類することをモデルに要求します。QNLIは、含意として再構成された質問応答タスクであり、モデルは文に質問への回答が含まれているかどうかを判断する必要があります。RTEは、ニュースとWikipediaから派生したより小さな含意タスクです。WNLIは、Winograd Schema Challengeに基づく代名詞解決タスクですが、後にデータ漏洩の問題により欠陥があることが判明し、多くのモデルはそれでランダムなパフォーマンスしか達成しませんでした。
評価指標は異なります:CoLAはマシューズ相関を使用し、SST-2とQNLIは精度を使用し、MRPCとQQPはF1スコアを使用し、STS-Bはピアソンおよびスピアマン相関を使用し、MNLI、RTE、およびWNLIは精度を使用します。最終的なGLUEスコアは、これらの指標の平均であり、各タスクは等しく重み付けされます。
影響と限界
GLUEは、モデルを比較するための共通ベンチマークを提供することで、この分野に大きな影響を与えました。これはNatural language processing研究の改善を促進し、そのリーダーボードは学術および産業の研究所の両方にとって競争の場となりました。このベンチマークはまた、マルチタスク学習アプローチの開発を促進し、NLPにおける転移学習の台頭に貢献しました。
しかし、GLUEは批判にも直面しました。一部の研究者は、このベンチマークが、言語を真に理解するのではなく、トレーニングデータ内のパターンを記憶するモデルによってゲームされる可能性があると指摘しました。WNLIタスクは特に問題があり、後にテストセットにトレーニングデータと適切に整列されていない例が含まれていることが判明し、モデルがうまく機能することがほぼ不可能になりました。これに応じて、GLUEチームは2019年にSuperGLUEと呼ばれる改訂版をリリースし、より難しいタスクを含み、これらの問題の一部に対処しました。
遺産と後継
その限界にもかかわらず、GLUEは広く引用されるベンチマークであり続け、新しいモデルを評価するためのベースラインとしてしばしば使用されます。その後継であるSuperGLUEは、複文推論や読解などのより複雑な推論を必要とするタスクを導入しました。両方のベンチマークは、生成AIシステムの評価を形成する上で影響力を持っていますが、MMLUやHELMなどの新しいベンチマークが、より広範な能力に対処するために登場しています。
GLUEの設計は、言語横断的理解のためのXGLUEや中国語のためのCLUEなど、他のドメインの同様のベンチマークにも影響を与えました。マルチタスク評価へのこのベンチマークの強調は、この分野の標準的な実践となり、その公開リーダーボードモデルは、その後の多くの取り組みによって採用されています。
関連項目
参考文献
- Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., & Bowman, S. R. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv preprint arXiv:1804.07461.
- Wang, A., Pruksachatkun, Y., Nangia, N., Singh, A., Michael, J., Hill, F., ... & Bowman, S. R. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv preprint arXiv:1905.00537.