SQuAD(スタンフォード・クエスチョン・アンサリング・データセット)は、[[question-answering|質問応答]]タスクの評価に用いられる機械読解用データセットである。

英語からの翻訳

SQuAD(斯坦福问答数据集)是一个阅读理解基准,由维基百科文章及其问答对组成,用于评估机器学习模型从文本中提取答案的能力。它推动了自然语言处理领域的重大进展。

Stanford Question Answering Dataset(一般にSQuADとして知られる)は、機械学習モデルの読解力と質問応答能力を評価するためのベンチマークデータセットである。これは、クラウドワーカーがウィキペディアの記事群に対して提起した質問で構成され、各質問の答えは対応する記事からのテキストの一部(スパン)である。SQuADは、自然言語処理の研究において、モデルが与えられた文章をどれだけ理解し、正確な答えを特定できるかを測定するために広く使用されており、現代の質問応答システムの発展における重要なマイルストーンとなっている。

SQuADは、スタンフォード大学の研究者によって導入され、2016年に初めて公開された。初期バージョン(後にSQuAD1.1と命名)には、536のウィキペディア記事から得られた10万以上の質問と回答のペアが含まれている。続くバージョンのSQuAD2.0は2018年に公開され、文章に情報が含まれない場合に回答を控えるモデルの能力を試すために設計された5万以上の回答不能な質問が追加された。このデータセットの人気は、そのクリーンな形式、スパンに基づく回答の客観性、そしてモデルの性能を比較するための単純明快な指標を提供する能力に由来する。

データセットの構造と作成

SQuADの構築には、Amazon Mechanical Turkを通じて募集されたクラウドワーカーが関与し、彼らはウィキペディアの記事を読み、答えが連続するテキストのスパンとなる質問を生成するよう求められた。記事は、歴史、科学、地理など様々なトピックをカバーする厳選された高品質なエントリのリストから選択された。各質問には単一の正確な回答スパンが対応付けられ、代替の有効な表現を考慮して追加の回答も収集された。元のSQuAD1.1データセットは、約8万7千の質問からなるトレーニングセットと約1万の質問からなる開発セットに分割され、公式評価用の非公開テストセットも用意された。

SQuAD2.0は、元の質問と新しい回答不能な質問を組み合わせることで、重要な課題を導入した。これらの敵対的例は、データセット内の段落に類似しているが、特定の事実(例えば、日付や名前の置き換え)が変更された段落に基づいてクラウドワーカーによって書かれた。その目的は、スパンが存在する場合に正しく回答するだけでなく、回答が存在しない場合に質問を拒否することをモデルに要求することであった。この開発は大きな影響を与え、多くの初期のシステムは回答拒否の要件を処理できず、新しいベンチマークで大幅な性能低下を引き起こした。

評価指標

SQuADの主要な指標はExact Match(EM)スコアであり、正規化(句読点や冠詞の除去など)後に予測が正解のいずれかと完全に一致する割合を測定する。二次的な指標であるF1スコアは、予測と正解のトークン間の重なりを計算し、部分的な一致を評価するより寛容な尺度を提供する。これらの指標は開発セット上で計算され、公式のリーダーボードが歴史的に提出物のランキングに使用されてきた。リーダーボードはスタンフォードNLPグループが運営する専用ウェブサイトでホストされ、最終更新まで競争的研究の焦点として機能した。

NLP研究への影響

SQuADは、深層学習トランスフォーマーベースのアーキテクチャの台頭と同時期に、自然言語処理の進化において極めて重要な役割を果たした。2016年の初期のトップシステムはリカレントニューラルネットワークとアテンションメカニズムに依存していたが、2017年のTransformerモデルの導入とその後の事前学習言語モデルは、状況を根本的に変えた。特に、OpenAIや他の研究所は、SQuAD1.1で人間を超える性能を達成したBERT(Googleの変種)などのモデルを公開し、後のモデルはSQuAD2.0で改善を続けた。SQuADは、GPTやAnthropicのClaudeなどの大規模言語モデルを含む新しいアーキテクチャの標準的なテストベッドとなり、開発中にしばしばこのベンチマークに対して評価される。

このデータセットの影響はリーダーボードを超えて広がる。SQuADは、他言語での抽出型質問応答やマルチドキュメントQAなどの派生データセットやタスクの作成を促進した。また、単一文章の抽出ではなくオープンドメイン設定に焦点を当てたNatural QuestionsやTriviaQAなどの後のベンチマークの設計にも影響を与えた。MIT CSAILバークレーAIリサーチ、その他の機関の研究者は、モデルの堅牢性、キャリブレーション、抽出型推論の限界を研究するためにSQuADを使用してきた。

限界と批判

その成功にもかかわらず、SQuADには顕著な限界がある。回答形式は連続するテキストスパンに制限されており、はい/いいえの質問、数え上げ、または文をまたぐ統合を必要とする回答は除外される。ウィキペディア由来の文章は比較的短く自己完結的であるため、このベンチマークはマルチホップ推論やノイズの多い実世界のテキストの処理などの能力をテストしない。クラウドワーカーが生成した質問も語彙的マッチングに偏る傾向があり、モデルは内容を真に理解するのではなく、質問の単語に類似したスパンを特定することを学習することで高いスコアを達成できる。これらの批判はより挑戦的なベンチマークの開発につながったが、SQuADは機械読解と質問応答の進歩を測定するための基礎的な参照点であり続けている。

遺産と現在の使用

SQuADは今でも学術論文で頻繁に引用され、人工知能の広範な分野におけるベースライン評価として使用されている。多くの現代の機械学習フレームワークは、SQuADをライブラリの標準データセットとして含み、自然言語処理の大学コースでの一般的な演習でもある。新しいモデルはSQuAD1.1ギャラリーで90%以上のEMスコアを達成することが多いが、このベンチマークの歴史的重要性は、構造化された読解タスクにおける訓練されたシステムの力を実証した役割にある。2020年代初頭の時点で、SQuADは汎用言語モデルを比較するための参照点であり続けているが、GLUEやSuperGLUEなどの評価スイートがより支配的になっている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:datasets·question-answering·natural-language-processing·benchmarks
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴