TriviaQAは、2017年にワシントン大学の研究者によって導入された、質問応答(QA)および読解のための大規模ベンチマークデータセットです。これは、自然に発生する質問、複雑で複数の文にわたる回答、およびかなりの量の裏付け証拠を提供することにより、初期のQAデータセットの限界に対処するために作成されました。このデータセットは、特にMachine learningモデル、とりわけDeep learningおよびTransformer (architecture)アーキテクチャに基づくモデルにとって、標準的な評価ツールとなっています。
このデータセットは、QuizLeague、Wikipedia、およびトリビアページのウェブクロールの3つのトリビアウェブサイトから収集された95,000件の質問と回答のペアから導き出された、65万件を超える質問・回答・証拠の3点セットで構成されています。各質問には、通常Wikipediaの記事からの複数の証拠文書がペアリングされており、これらに回答が含まれています。この設計により、モデルが長い文章を検索して推論することが強制され、単一段落の抽出に焦点を当てていたSQuADなどの初期のデータセットよりも困難になっています。
構築と統計
TriviaQAは、まずウェブからトリビアの質問とその回答をスクレイピングして構築されました。質問は自然に表現され、多くの場合、マルチホップ推論や時間的推論、一般的な世界知識を含んでいます。各質問に対して、作成者らはBing検索とWikipediaリンク照合の組み合わせを使用して関連する証拠文書を収集し、その結果、質問あたり平均6件の証拠文書が得られました。
データセットはトレーニングセット、開発セット、テストセットに分割されています。トレーニングセットには78,785件の質問と回答ペア、開発セットには8,837件、テストセットには11,313件が含まれています。注目すべき特徴として、証拠がウェブ文書に限定された『webのみ』分割と、証拠がWikipediaのみに由来する『wikipediaのみ』分割の存在が挙げられます。これにより、研究者はドメイン固有の検索効果を分離できます。
評価と指標
TriviaQAの標準的な評価には、他のQAベンチマークと同様に、完全一致(EM)スコアとF1スコアが使用されます。EMは、予測が受け入れられた回答の1つと完全に一致する割合を測定し、F1はトークンレベルの重複を計算します。モデルは通常、外部検索を伴わずパラメトリック知識に依存するクローズドブック設定と、提供された証拠の検索を伴うオープンブック設定で評価されます。
リリース以来、TriviaQAはLarge language model研究の進歩の主要な牽引役となっています。BiDAFやDrQAなどの初期のNeural networkモデルでは控えめなスコアを達成しましたが、BERTやT5などのTransformer (architecture)ベースのモデルの登場により、大幅な進歩がもたらされました。2021年までに、OpenAIのGPT-3やGoogleのT5などのモデルは開発セットで70%以上のEMを超えることができ、2023年までに、GPT-4やClaudeなどのGenerative AIシステムは、一部のサブセットで90%以上のEMを達成したとの報告があり、ほぼ人間並みのパフォーマンスを示しました。
AI研究への影響
TriviaQAは、Artificial intelligenceの研究のいくつかの領域に影響を与えてきました。これにより、読書理解システムのトレーニングと評価に、自然界で自然に発生する質問を大規模に使用することが普及しました。このデータセットはまた、システムが事前切断された証拠なしに大規模なコーパスを検索して推論しなければならないオープンドメインQA 、つまりエンドツエンドでは選ばれる質問の研究も促進しました。この研究グプは、密な方言文検索(DPR)などの進化技術の開発に寄与し、現在では多くの本番QAシステムに不可欠な要素となっています。
さらに、TriviaQAはモデルの堅牢性と予測の不確実性の評価にもてて使用されています。研究者は、モデルが理解に満ちた質問、マルチホップ推論、回答形式をどのように処理するかを分析してきました。このデータセットの多様な質問タイプは、Natural QuestionsやHotpotQAなどの他のデータセットと並んで、Large language modelの知識と推論能力を調べるための一般的なベンチマークとなっています。
制限と批判
その人気にもかかわらず、TriviaQAには既知の制限があります。質問は主に事実と数トリビアに焦点を当てており、会話型やタスク型の質問を促すといった現実世界のQAニーズを反映していないかもしれません。証拠文書は場合によってはノイズが含まれており、回答が複数の形式で存在する場合があるため、評価の不一致が生じる可能性があります。さらに、このデータセットは、潜在的な回答漏洩について批判されてきました。つまり、質問がウェブからスクレイピングされたため、一部の回答は大規模な言語モデルのトレーニングコーパスに存在する可能性があり、クローズドブック設定でのパフォーマンスを水増ししています。
これらの問題に対処するため、研究者はフィルタ処理されたバージョンやTriviaQAと他のデータセットを組み合わせてより強力な安全なベンチマークを作成することを提案しています。それでも、TriviaQAは、特にオープンドメインのQAタスクという知識集約型タスクのモデルのとの性能を説明するための比較として考えられます。
遺産と継続的な使用
TriviaQAは、Google DeepMind、Anthropicなどの主要なAI研究の評価基準に、その他に学術研究所としてのStanford AI LabやBAIR (Berkeley AI Research)などが含まれています。これは一般的な知識と推論の尺度として、モデルカードや技術報告書に頻繁に含まれています。このデータセットの設計は、Natural QuestionsやWebQuestionsなどの「マルチ証拠」構造を採用したその後のベンチマークのインスピレーションにもなっています。
2020年代半ばの時点で、TriviaQAは依然として関連性がありますが、最先端の業界の状態のモデルは、人間のベースラインに近いまたはそれを超えるスコアを達成することがよくあり、その優れた能力は、ベンチマークが飽和に近づいていると主張する基準を引き起こしています。それでも、これはQAシステムの進化の歴史的なマイルストーンとしてさらに、学術および業界の設定で、ファインチューニングや評価に使用されています。