HotpotQAは、人工知能システムをマルチホップ質問応答において訓練・評価するために設計された大規模データセットである。。これは2018年にカーネギーメロン大学とワシントン大学の研究者チームによって導入された。データセットは113,000以上の質問と回答のペアで構成され、各ペアはモデルがWikipediaからの複数の支持文書を横断して推論し、正しい回答に到達することを要求する。単一の文章に依存するより単純な質問応答ベンチマークとは異なり、HotpotQAは明示的にシステムのマルチホップ推論能力を試す。これは複数の情報源からの情報を論理的な連鎖で結びつけることを含む。
HotpotQAの主な目的は、機械読解と推論の研究を前進させることである。これは以前のデータセットの重大な限界に対処するものであり、それらはしばしば単一の段落から回答可能な質問を含んでいた。二つ以上の文書からの情報の統合を要求することにより、HotpotQAはモデルをより洗練された理解と推論へと押し進める。データセットは機械学習および人工知能の分野でベンチマークとして広く使用され、特に大規模言語モデルおよび他のニューラルアーキテクチャの推論能力を評価するために用いられる。
データセット構築
HotpotQAデータセットは二段階のクラウドソーシングパイプラインを用いて作成された。まず、ワーカーは複数のWikipedia記事からの情報を必要とする質問を書くよう求められ、回答がどの単一記事にも見つからないという制約が課された。次に、これらの質問は検証され、支持事実はアノテーターによって特定された。各質問には支持事実のリストが付随し、これは回答に必要な証拠を提供するソース文書からの特定の文である。この設計により、回答予測と証拠抽出の両方が可能となり、モデルの推論のより透明な評価を可能にする。
データセットには二つの主要な種類の質問が含まれる:橋渡しと比較である。橋渡し質問は、ある文書のエンティティを別の文書に結びつけることを要求し、例えば映画をその監督に結びつけて人物の出生地を特定するようなものである。比較質問は、二つのエンティティの属性を対比することを要求し、例えば二つの川のどちらが長いかを決定するようなものである。この多様性は、モデルが単純な事実検索だけでなく、異なる推論パターンを扱わなければならないことを保証する。
評価指標
HotpotQAは通常、複数の指標を用いて評価される。回答予測については、主要な指標は完全一致(EM)であり、これは予測が正解と完全に一致する割合を測定する。さらに、F1スコアが部分一致を考慮するために使用され、予測と正解の間のトークンの重複を考慮する。支持事実予測タスクについては、結合F1およびEMスコアが計算され、モデルが正しい証明文を特定することを要求する。これらの指標は、最終回答の正確さと推論プロセスの両方の包括的な評価を提供する。
元の2018年のリリースでは、データセットは訓練、開発、およびテストセットに分割され、テストセットは公開リーダーボードに使用された。リーダーボードは研究者が自分のモデルを最先端のアプローチと比較することを可能にし、この分野での急速な進歩を促進した。時間の経過とともに、HotpotQAは自然言語処理コミュニティで標準的なベンチマークとなったが、提供されたリンクスラッグには明示的にリストされていない。
AI研究への影響
HotpotQAは推論モデルの開発に大きな影響を与えてきた。これは注意機構、メモリネットワーク、およびグラフベースの推論を組み込んだアーキテクチャの革新を推進した。例えば、初期のモデルはトランスフォーマーベースのエンコーダを使用して質問と複数の文書を共同でエンコードし、後のアプローチはグラフニューラルネットワークを使用して文書間のエンティティ間の関係をモデル化した。データセットはまた、説明可能性の重要性を強調し、支持事実のアノテーションにより研究者がモデルが特定の予測を行った理由を分析することを可能にする。
データセットは、OpenAI、Anthropic、およびGoogle DeepMindによって開発されたものなどの現代の大規模言語モデルの推論能力を評価するために使用されてきた。これらのモデルは、しばしばファインチューニングまたは少数ショット例でプロンプトされ、HotpotQAで高いスコアを達成し、マルチステップ推論の能力を示している。しかし、データセットは依然として挑戦的であり、モデルは複雑な時間的または因果的推論を必要とする質問に依然として苦労している。近年では、最先端のシステムは開発セットで90%以上の完全一致を達成しているが、テストセットのリーダーボードは改善の余地が続いていることを示している。
限界と批判
その人気にもかかわらず、HotpotQAは批判に直面してきた。一つの限界は、質問がクラウドワーカーによって生成されることであり、バイアスや不自然な言い回しを導入する可能性があることである。さらに、データセットは唯一の知識源としてWikipediaに焦点を当てており、トピックの多様性を制限し、情報がさまざまな領域に散在する現実世界の質問応答シナリオを反映しない可能性がある。一部の研究者は、モデルが真の推論を行うのではなく、エンティティ共起パターンに依存するなどの近道を悪用できることを指摘している。これは、そのような問題を軽減することを目的としたより挑戦的なベンチマークの開発につながった。
もう一つの懸念は、データセットの静的な性質である。Wikipediaは常に更新されるため、HotpotQAで使用される文書は時代遅れになる可能性があり、時間の経過に伴う評価の妥当性に影響を与える可能性がある。しかし、データセットは固定された文書とアノテーションのセットを提供するため、制御された実験のための貴重なリソースであり続ける。
関連ベンチマーク
HotpotQAはマルチホップ質問応答データセットのより広いファミリーの一部である。これはしばしばQAngaroo、ComplexWebQuestions、およびMuSiQueなどの他のベンチマークと比較される。これらのデータセットは、規模、質問の複雑さ、および必要なホップ数において異なる。HotpotQAの支持事実アノテーションへの強調は、それを他の多くのものから区別し、証拠ベースの推論の研究に特に有用である。深層学習およびニューラルネットワークの文脈では、HotpotQAは新しいアーキテクチャと訓練パラダイムを開発するための厳格なテストベッドとして機能する。