WikiHopは、人工知能システムにおける多段推論(マルチホップ推論)能力を評価し、発展させるために設計された機械読解データセットである。2016年にユニバーシティ・カレッジ・ロンドンとDeepMindの研究者らによって導入されたこのデータセットは、それ以前の読解ベンチマークにおける根本的な限界、すなわち単一の質問に答えるために複数の文書を横断して推論する必要性に対処するために作成された。答えが単一のパッセージに含まれるより単純なデータセットとは異なり、WikiHopはモデルが複数の異なる情報源から情報を収集し統合することを要求し、人間がトピックを調査する際に行う複雑な証拠収集型の推論を模倣している。
このデータセットはウィキペディアの記事から構築され、各インスタンスは質問、一連の支持文書、および一連の候補回答で構成される。質問は、単一の文書に完全な答えが含まれないように設計されており、代わりにモデルは複数の文書にわたって関連情報を特定し、それらを結び付けて正しい回答を推論しなければならない。例えば、ある記事で言及されている人物の国籍を問う質問があり、その答えには別の記事にあるその人物の出生地に関する情報が必要となる場合がある。この構造により、モデルは各ホップが証拠を別の証拠に結び付ける推論のステップに対応する多段推論を実行することを強いられる。
構築と設計
WikiHopの作成には半自動化されたパイプラインが関与した。研究者らはまず、伝記、出来事、実体など多様なトピックに関するウィキペディアの記事を選択した。その後、テンプレートのセットを使用して質問と候補回答を生成した。各質問について、必要な情報をまとめて含む「支持」文書のセットを特定した。このデータセットの重要な特徴は、自明な回答を「抑制」することに焦点を当てている点である。候補回答には、文書内に存在するが正解ではないもっともらしい妨害選択肢が含まれており、モデルが単純な語彙照合に頼るのではなく、注意深く推論することを強制する。
このデータセットは、WikiHop(オリジナル)とWikiHop(マスク版)の2つのバージョンで公開された。マスク版は候補回答の選択肢を削除し、モデルが直接回答を生成することを要求するため、より困難なタスクとなる。オリジナル版には、トレーニング用に43,738問、検証用に5,129問、テスト用に2,451問が含まれており、質問あたり平均約4.5件の支持文書がある。質問は、歴史や地理から科学や大衆文化まで、幅広い領域にわたる。
重要性と影響
WikiHopは、機械学習および深層学習モデルにおける多段推論を評価するための標準ベンチマークとなった。これは、初期のニューラル読解システムの能力における重大なギャップを浮き彫りにした。これらのシステムは単一文書タスクでは優れていることが多かったが、複数の情報源にわたって情報を統合する必要がある場合には苦戦した。このデータセットは、メモリ拡張ネットワークやグラフベースの推論モデルなど、文書間で証拠を明示的に追跡し組み合わせるように設計された新しいアーキテクチャとトレーニング技術の開発を促進した。
このベンチマークはまた、HotpotQAやMultiHopなど、その後のデータセットの設計にも影響を与え、多段推論の課題をさらに洗練させた。WikiHopの複数文書推論への重点は、大規模言語モデルの開発に特に関連性が高い。これらのモデルは、オープンドメインの質問応答やファクトチェックなど、多様な情報源からの情報を統合する必要があるタスクにますます使用されているためである。
限界と批判
その影響力にもかかわらず、WikiHopは批判にも直面している。一部の研究者は、このデータセットの質問が、真の多段推論なしに、実体の共起などの表面的な手がかりを使って回答できる場合があると指摘した。候補回答はしばしば支持文書内に存在し、モデルが単純なパターンマッチングを使用できるようにしていた。さらに、テンプレートから生成された質問の合成的な性質は、現実世界のクエリの複雑さと曖昧さを完全には捉えていなかった。これらの限界により、より挑戦的で現実的なベンチマークの必要性が認識されるようになり、より自然な言語とより複雑な推論要件を備えたデータセットの作成が促された。
もう一つの限界は、現代のベンチマークと比較してデータセットの規模が比較的小さいことであり、過学習につながる可能性がある。その結果、WikiHopは、モデルの推論能力をより包括的に評価するために、他のデータセットと併用されることが多い。
遺産と継続的な関連性
その古さにもかかわらず、WikiHopはニューラルネットワークモデルの推論能力を探るための有用なツールであり続けている。これは、人工知能の解釈可能性に関する研究や、トランスフォーマーベースのモデルの失敗モードを分析する研究で頻繁に使用されている。このデータセットの設計原則、特に複数文書の証拠と妨害回答への焦点は、より洗練された評価フレームワークの開発に情報を与えてきた。2020年代半ば現在、WikiHopは文献で引き続き引用されており、その方法論は、多段推論が不可欠な医療や法律の推論など、他の領域にも適応されている。
このデータセットはまた、自然言語処理ベンチマークの進化における歴史的な指標としても機能し、単純な事実に基づく質問応答から、より複雑で推論集約的なタスクへの移行を示している。その作成は、トロント大学や他の機関の研究者らによる共同作業であり、この分野の学際的な性質を反映している。