GLUE-ZHは、中国語テキストにおけるモデルの汎用言語理解能力を評価するために設計されたベンチマークスイートである。これは英語版GLUE(General Language Understanding Evaluation)ベンチマークの構造に従い、そのタスクと評価方法論を中国語に適応させたものである。このベンチマークは、モデルのパフォーマンスを一連の基本的なNLPタスクにわたって反映する単一の総合スコアを提供し、中国語自然言語処理における異なるアプローチの直接比較を可能にする。
このベンチマークは、急速に進歩する深層学習と大規模言語モデルの分野に対する多言語評価基準を作成するという広範な取り組みの一環として、2010年代後半に導入された。元のGLUEベンチマークは2018年にニューヨーク大学とワシントン大学の研究者によって公開されたが、GLUE-ZHは標準化された中国語NLP評価への高まるニーズに応えるため、コミュニティ主導の適応として登場した。これは学術および産業の研究グループのコンソーシアムによって開発されたが、単一の公式なリリース日や論文は広く認識されておらず、ベンチマークの正確な構成は実装によって異なっている。
タスク構成
GLUE-ZHは通常、英語版GLUEスイートを反映した一連のタスクを含むが、中国語のデータセットを使用する。一般的なタスクには以下が含まれる:
- 文レベルの分類:感情分析(例えば、中国語のChnSentiCorpデータセットを使用)や質問応答型自然言語推論(例えば、MultiNLIコーパスの中国語版であるCMNLIデータセット)などのタスク。
- テキスト類似性:中国語意味テキスト類似性(STS-B)などのタスク。これは2つの文が0から5のスケールでどれほど意味的に類似しているかを測定する。
- 単文タグ付け:中国語の単語分割や品詞タグ付けなどのタスク。これらは単語間にスペースがない中国語NLPにとって不可欠である。
- 読解:CMRC2018(中国語機械読解)などのタスク。これはモデルが与えられた文章に基づいて質問に答えることを要求する。
GLUE-ZHのタスクの正確な数はバージョンによって異なり、一部の実装では5つだけのタスクを含むものから、9つ以上に拡張するものまである。最も一般的に引用される構成は7つのタスクを含み、分類、類似性、推論をカバーしている。
評価方法論
GLUE-ZHは英語版GLUEベンチマークと同様のスコアリングシステムを使用する。各タスクには特定の指標(例えば、分類タスクでは正解率、類似性タスクではピアソン相関)があり、最終的なGLUE-ZHスコアはすべてのタスク固有スコアの平均である。この総合スコアにより、モデルパフォーマンスの単一数値比較が可能になり、評価プロセスが簡素化される。
モデルは通常、ゼロショットまたはファインチューニングの設定で評価される。ゼロショット設定では、モデルはタスク固有のトレーニングなしでGLUE-ZHタスクでテストされ、その一般的な言語理解能力を測定する。ファインチューニング設定では、モデルは評価前に各タスクのトレーニングデータでトレーニングされ、特定の下流タスクへの適応性を測定する。
歴史的背景と使用
GLUE-ZHは、2010年代後半から2020年代初頭にかけてのTransformerベースモデルの台頭中に注目を集めた。これは、BERTベースの変種(例えば、BERT-wwm、RoBERTa-wwm)やERNIEなどの中国語事前学習モデルに焦点を当てたいくつかの研究論文や技術レポートでベンチマークとして使用された。これらのモデルはGLUE-ZHで一貫して高いスコアを達成し、最良のモデルは2021年までに80%以上の総合スコアに達した。
このベンチマークは、その範囲が限られていると批判されてきた。主に文レベルのタスクに焦点を当てており、対話生成や文書レベルの理解などのより複雑なタスクを含んでいないためである。さらに、単一の公式バージョンがないため、異なる研究間で報告された結果に不整合が生じ、直接比較が困難になっている。
他のベンチマークとの関係
GLUE-ZHは、SuperGLUE(英語版GLUEの後継)やXTREME(言語横断ベンチマーク)を含む多言語ベンチマークのファミリーの一部である。XTREMEには多くの言語の1つとして中国語が含まれる一方、GLUE-ZHは中国語に特化したより深い評価を提供する。また、2020年に公開され、中国語NLPのためのより包括的で標準化された評価スイートを提供する中国語SuperGLUE(CLUE)ベンチマークとも関連している。CLUEは、より大きなタスクセットと公式リーダーボードにより、研究用途ではGLUE-ZHをほぼ取って代わっている。
現在の状況
2020年代半ばの時点で、GLUE-ZHは最先端の研究ではあまり使用されておらず、CLUEや中国語版SuperGLUEなどのより包括的なベンチマークに取って代わられている。しかし、中国語NLP評価の進化を理解するための有用な参考資料として残っており、一部の教育資料や歴史的分析で今も引用されている。このベンチマークの影響は、同様のタスクタイプとスコアリング方法論を組み込むことが多い新しい評価スイートの設計に持続している。