WNLI(Winograd Natural Language Inferenceの略)は、自然言語処理におけるベンチマークタスクであり、AIシステムがWinogradスキーマに対して自然言語推論を行う能力を評価するものである。Winogradスキーマとは、単一の単語または句のみが異なる文のペアであり、代名詞やその他の曖昧な参照の解決方法が異なるものを指す。のタスクは、与えられた仮説が前提に対して含意(entailment)、矛盾(contradiction)、または中立(neutral)のいずれであるかを問うものであり、正しい答えは単純な語彙パターンではなく、実世界の文脈の理解に依存する
このベンチマークは、GLUE(General Language Understanding Evaluation)スイートの一部として導入された。のスイートは、機械学習モデルの一般的な能力を測定するために設計された9つの自然言語理解タスクの集合である。WNLIは、常識推論と共参照解決を探るために特に含まれており、これらの分野は、初期のニューラルモデルが他のタスクで強い性能を示したにもかかわらず、しばしば失敗する領域であった。データセットは、2011年にHector Levesqueによってチューリングテストの代替として提案された元のWinograd Schema Challengeから派生しており、人間には容易であるが機械には困難な問題に焦点を当てている
構造と例
各WNLIインスタンスは、前提文、仮説文、および仮説が前提から導かれるか(含意)、矛盾するか(矛盾)、または無関係であるか(中立)を示すラベルで構成される。前提には通常、曖昧な代名詞が含まれており、仮説はその代名詞を2つの可能な方法のいずれかで解決する。例えば、前提「The trophy doesn't fit in the brown suitcase because it is too small」は、仮説「The trophy is too small」(含意)または「The suitcase is too small」(矛盾)と対にすることができる。正しいラベルは、物理的なサイズ関係と典型的な物体の特性の理解を必要とする
元のWinograd Schema Challengeには273のそのような例が含まれているが、GLUE版のWNLIにはこれらのサブセットが含まれており、自然言語推論形式に再フォーマットされている。タスクは、単語頻度や共起などの統計的手がかりが、それを確実に解決するには不十分であるように意図的に構築されている。れにより、WNLIは、モデルが日常的な状況について真の推論を行うことができるかどうかの強力なテストとなる
歴史的な性能と課題
GLUEが2018年にリリースされたとき、WNLIは当時のモデルにとって最も困難なタスクの1つであることが判明した。多くの初期システムは、リカレントニューラルネットワークや初期のトランスフォーマーアーキテクチャに基づくものを含め、ランダム推測をわずかに上回る精度しか達成できなかった。注目すべき問題は、WNLIのトレーニングセットが非常に小さく、わずか634のトレーニング例しか含まれておらず、検証セットはさらに小さかったことである。の限られたデータは、モデルが一般化可能なパターンを学習することを困難にした
重大な複雑化は、元のWinograd Schema Challengeの例が自然言語推論形式用に設計されていなかったという事実から生じた。の変換プロセスが不整合を導入し、いくつかの例には曖昧または議論の余地のあるラベルがあったことが、複数の研究者によって観察された。2019年には、ワシントン大学のチームによる論文が、多くのWNLI例が単純なヒューリスティック、例えば特定の文構造に対して常に「含意」を予測すること、によって解決できることを示し、ベンチマークの意図された難しさを損なった。れにより、WNLIは常識推論の信頼できる尺度ではないという批判が生じた
現代のAIシステムとの関係
OpenAI、Anthropic、およびGoogle DeepMindによって開発されたものなどの大規模言語モデルの出現に伴い、WNLIでの性能は劇的に向上した。数十億のパラメータを持つ現代のトランスフォーマーモデルは、ベンチマークでほぼ完璧な精度を達成できる。かし、この改善は、モデルが事前学習中に膨大な量のテキストにさらされたことに一部起因しており、その中にはWinogradスキーマ自体の言い換えが含まれる可能性がある。の結果、一部の研究者は、WNLIでの高得点はもはや真の推論能力を示すものではなく、トレーニングデータからの記憶またはパターンマッチングを示すものであると主張している
このベンチマークは、SuperGLUEなどのより広範な評価スイートにも組み込まれており、そこではWNLIはWinograndeと呼ばれるより堅牢なバージョンに置き換えられた。Winograndeは、データセットを44,000以上の例に拡張し、自然言語推論ではなく二択形式を使用することで、元のタスクの弱点のいくつかに対処している。れらの変更にもかかわらず、WNLIは自然言語理解ベンチマークの発展における歴史的に重要な参照点であり続けている
批判と遺産
WNLIは、広範な方法論的批判の対象となってきた。データセットの小規模さ、不整合なラベル付け、およびモデルが表面レベルのパターンを利用する容易さは、すべて文書化されている。2021年には、アレン人工知能研究所の研究者による分析が、単純なルールベースシステムがWNLIで70%以上の精度を達成でき、当時の多くのニューラルモデルの性能をはるかに上回ることを発見した。の調査結果は、注意深いベンチマーク設計の重要性と、敵対的評価方法の必要性を浮き彫りにした
これらの問題にもかかわらず、WNLIは共参照解決と常識推論の研究を前進させる上で重要な役割を果たした。れは、スパンベースの予測や知識強化モデルなどの新しいアーキテクチャとトレーニング技術の開発を動機付けた。WNLIから学んだ教訓は、その後のベンチマークの設計に影響を与え、Winograndeやより広範なGLUEおよびSuperGLUEスイートを含むこれらは、大規模言語モデルの評価において広く使用され続けている
現在の状況
2020年代初頭の時点で、WNLIは単独の評価指標として使用されることは稀であり、より堅牢なデータセットに取って代わられている。かし、それは歴史的分析や研究論文のベースラインとして引き続き登場している。のタスクの遺産は、記憶ではなく推論を真にテストするベンチマークを作成するための継続的な取り組みの中に存続しており、これはArtificial intelligenceの分野の中心的な課題であり続けている。のWNLIが由来する元のWinograd Schema Challengeは、統計的学習の限界と記号的推論能力の必要性に関する議論の中で今も参照されている