Natural Questions Open

英語からの翻訳

Natural Questions Openは、オープンドメインの質問応答のためのベンチマークデータセットであり、Googleの検索クエリから派生し、回答は人間によって注釈が付けられています。

Natural Questions Openは、オープンドメイン質問応答(QA)のためのベンチマークデータセットである。2019年にGoogleによってNatural Questions(NQ)データセットの一部として導入された。NQデータセットは、Google検索エンジンに送信された実際の匿名化されたクエリで構成されている。「Open」バリアントは、単一のWikipediaページのコンテキストを排除し、Wikipediaなどの大規模なコーパスから直接質問に回答することを要求するため、検索拡張型QAシステムの標準的な評価セットとなっている。

このデータセットには30万以上の自然な質問が含まれており、各質問には短い回答(テキストのスパン)と長い回答(Wikipediaの段落)がペアで付与されている。正式にはNatural Questions - Openとして知られるOpenバージョンは、ページレベルの教師情報を破棄し、オープンな文書コレクションから回答を見つけるシステムの能力を評価することで、元のタスクを簡素化している。この設定は、Transformer (architecture)アーキテクチャや大規模言語モデルに基づくものを含む、オープンドメインQAモデルを比較するための標準的なテストベッドとなっている。

Natural Questions Openの開発は、人工知能、特に機械学習深層学習における広範な進歩と一致している。このベンチマークは、BERTなどのニューラルネットワークや、その後の生成AIモデルに基づくシステムの性能を測定するために使用されてきた。研究者はしばしば、検索拡張生成と、マルチヘッドアテンション位置エンコーディングを活用するモデルを組み合わせて、検索されたテキストを推論している。

タスクと評価

オープンドメイン設定では、システムは各質問に対して、通常は短いスパンである回答を返さなければならない。評価には、予測された回答を注釈付きの回答と比較し、句読点や冠詞の正規化を行った上で、完全一致(EM)スコアとF1スコアの指標が使用される。データセット全体には開発用とテスト用の分割が含まれており、堅牢なモデル開発と比較が可能となっている。

システムは通常、2段階のアプローチを採用する。まず、検索器がWikipediaから関連するパッセージを選択し、次に読み取り器(多くの場合、エンコーダー・デコーダーまたはシーケンス・ツー・シーケンスモデル)が回答を抽出する。ビームサーチデコーディングとトップkサンプリングは、回答を生成するための一般的な戦略である。

ベンチマークの影響

Natural Questions Openは、SQuADやTriviaQAと並んで、オープンドメインQAの広く採用されたベンチマークの1つとなった。これは、Transformer (architecture)ベースの検索と生成を組み合わせたREALM(2020年)やRAG(2020年)などの検索拡張アーキテクチャの台頭に貢献した。2021年には、Andorraシステムが検索器・読み取り器アーキテクチャと微調整された生成AIモデルを組み合わせた。このデータセットは、Google DeepMindやその他の人工知能研究所によっても、質問応答機能を前進させるために使用されている。

オープンドメインQAのタスクは、長い回答を含むより豊かな注釈を持つ元のNatural Questionsの構成と密接に関連している。その開放性は、明示的な検索なしに回答を生成しなければならない可能性がある大規模言語モデルシステムにとっての課題となっている。

最近の動向

2020年代初頭の時点で、大規模な事前学習モデルに基づくシステムはテストセットで強い結果を達成しており、EMスコアは50%を超えている。例えば、2021年のGoogle Researchのモデルはテストセットで54.6%のEMを達成し、検索と生成AIを組み合わせたアプローチは、その後56.4%とより高いスコアに達した。2022年には、AI研究所からの通知で、テキスト生成を調整するための強化学習RLAIFの適用が指摘された。ただし、正確なリーダーボードの主張は時間とともに変動する可能性がある。

実世界での応用

Natural Questions Openの検索に関する洞察は、商業システムに影響を与えている。例えば、質問の希薄化による検索の劣化や密な検索の必要性は、Google CloudAmazon Web Servicesによって検索に使用されている。同様のセットは、音声アシスタントやコンピュータベースのシステムを評価するためにもよく使用される。それでもなお、このデータセットはQA研究の主要なサブラインとして残っている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:natural-language-processing·question-answering·benchmark·dataset
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴