英語からの翻訳

SQuAD 1.1は、ウィキペディアの記事から派生した100,000以上の質問と回答のペアからなる読解ベンチマークデータセットであり、テキストの機械理解を評価するために使用されます。これは2016年にスタンフォード大学によって導入されました。

SQuAD 1.1(Stanford Question Answering Dataset)は、自然言語処理における読解力と質問応答システムを評価するために広く使用されるベンチマークである。このデータセットは、クラウドワーカーがウィキペディアの記事群に基づいて作成した10万以上の質問と回答のペアで構成される。各質問は、対応する記事から連続したテキストの範囲を抽出することで回答できるため、SQuAD 1.1はスパン抽出タスクとして位置づけられている。2016年にスタンフォードAI研究所の研究者によって導入され、以降、機械読解の進歩を測定する標準的な基準点となっている。

SQuAD 1.1の主な目的は、モデルが与えられた文章を理解し、その中の質問に対する正確な回答を特定できるかを検証することにある。生成型の質問応答タスクとは異なり、SQuAD 1.1ではモデルが提供された文脈の部分文字列を出力することが求められる。この設計により評価が簡素化され、完全一致率(Exact Match)とF1スコアに基づく自動スコアリングが可能となる。データセットは歴史、科学、伝記など、ウィキペディアの多様なトピックを網羅しており、事実知識の幅広いカバー範囲を保証している。

データセットの構築

SQuAD 1.1の構築には、記事の選択と質問応答の生成という2つの主要な段階が含まれた。作成者らは地理、スポーツ、娯楽などの各種カテゴリから、ウィキペディアの536記事を選定した。その後、クラウドワーカーに各記事を読ませ、テキスト内の特定の文または句で回答できる質問を生成させた。さらに、彼らは正確な回答スパンも提供した。それは後に追加のワーカーによって検証された。このプロセスにより、107,785件の質問応答ペアが生成され、記事ごとに平均約200の質問が含まれることとなった。

SQuAD 1.1の各質問は単一の回答スパンと関連付けられているが、記事に同義の句が存在する場合、複数の有効な回答を持つ質問もある。データセットは学習用セットの87,599問と開発用セットの10,570問に分割され、残りの質問は隠されたテスト評価用に確保された。開発用セットはモデル調整によく使用されを、テスト用セットは公式リーダーボードの提出用に予約されている。

評価指標

SQuAD 1.1は、完全一致(Exact Match、EM)とF1 スコアという2つの主要な指標を用いて評価される。EMは、予測がグランドトソースである正解と完全に一致する割合を測定しであり、句読や冠詞の違いは無視される。F1スコアは、予測された回答と真の回答との間の適合率と再現の調和平均を計算し、部分一致を考慮したより寛容な指標を提供する。どちらの指標も、データセット内の全質問に対して平均化される。

例えば、真の回答が「バラク・オバマ」で、モデルが「オバマ」を予測した場合、その質問のEMスコアは0になるが、F1スコアは0.5になる(4つのトークンのうち2つが一致する)。これらの指標は分野の標準となり、その後多くのベンチマークが同様の評価プロトコルを採用しています。初期のベースラインモデルはニューラルネットワークを使用しF1スコア約70%を達成し、一方、人間の性能はF1で91.2%、EMで82.35と推定されている。

研究への影響

SQuAD 1.1は、特に読解のための深層学習モデルの開発において、自然言語処理研究の進展に重要な役割を果たした。公開される前は、多くの質問応答システムは手作業の特徴量と伝統的な機械学習手法に依存していました。このベンチマークは、注意機構やトランスフォーマーベースモデルのようなより洗練されたモデルの開発を後押しする大規模で標準化されたテストを提供した。特に、ニューラルネットワークベースのアーキテクチャの改良が進んだ。

BiDAF(双方向注意フローモデル)やその後のBERTスタイルのプレトレーニードモデルなど、多くの影響力のあるモデルがSQuAD 1.1で性能を評価された。これらのモデルの成功は、トランスファーク式学習と大規模言語モデルが文脈理解におえて効果的であることを実証した。さらに、このデータセットは、性能と効率を向上させるためのデータ拡張モデル刈り込みの研究を促進した。

制限と遺産

その人気にもかかわらず、SQuAD 1.1には既知の制限が存在しています。スパン抽出形式は回答を連続したテキストに限定しており、複数の文にまたがる合成や推論が必要な実世界の質問応答シナリオを反映していません。また、このデータセットには一部のバイアスが含まれています。名のあるエンティティや日付に焦点を当てた質問が多くなる傾向がありで、モデルが深い理解ではなく表面的なパターンに依存することができます。

これらの問題に対処するため、SQuAD 2は従来バージョン。などの応答不可能な質問を導入し、Natural QuestionsTriviaQAなどの他のベンチマークはスープを拡張した。それでもSQuAD 1.1は分野の基礎リソースとして残っています。大規模言語モデルの事前学習やファインチューニングのタスクとして頻繁に使用され、新しいアーキテクチャの評価のためのベースラインとして、現代の読解システムの開発においても、学術的に用途にも影響を与えています。Google DeepMindOpenAIなどの多くの業界チームも、そのシステムの検証に使用しています。

結論

SQuAD 1.1は、現代の読解方式システムの開発を形成した画期的なデータセットである。大規模で学習品質の高いコーパスと明確な評価指標を提供することで、人工知能の急速な進歩を可能にし、研究者や実践者にとって重要な基準となっています。新しいベンチマークが登場していますが、SQuAD 1.1のシンプルさと堅牢性は、その継続的な関連性を保証しています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·reading-comprehension·question-answering·nlp-benchmark
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴