スタンフォード質問応答データセット(SQuAD)は、人工知能システムがテキストを理解し質問に答える能力を評価するために広く使用されるベンチマークである。スタンフォードAIラボの研究者によって開発されたSQuADは、クラウドワーカーがウィキペディアの記事のセットに対して提起した多数の質問で構成されている。各質問には対応する回答があり、それは関連記事から直接抽出されたテキストの範囲である。この形式は抽取型質問応答として知られている。このデータセットは、自然言語処理の分野における機械学習およびディープラーニングモデルの標準的なテストベッドとして機能し、人工知能研究の核心領域である。
2016年に初めて公開されたSQuADは、予測された回答文字列と正解の完全一致(EM)およびトークンレベルのF1スコア(部分一致を考慮する)の両方を測定する厳密な評価手順を導入した。この二重メトリックは、質問応答研究の事実上の標準となった。初期のバージョンはSQuAD1.1と呼ばれ、500以上の記事から派生した10万組以上の質問と回答のペアを含んでいる。2018年にリリースされた後続バージョンのSQuAD2.0は、5万以上の無回答質問を追加し、モデルが回答が存在しないことを認識する能力をテストすることを目的とした。これにより、タスクはより困難で現実的なものとなった。
構造と内容
データセットはウィキペディアの記事から構築されており、主に著名な人物、出来事、トピックをカバーしている。クラウドワーカーは各記事を読み、記事内のテキストの範囲で回答できる質問を生成する。たとえば、「どの会社がチューリングマシンを開発したのか?」という質問には、本文中に言及された特定の会社名が回答となる。各質問-回答のペアには、記事からのコンテキスト段落がペアリングされ、回答はその段落内での開始位置と終了位置がアノテーションで注記される。この設計により、タスクは純粋に抽出画像であることが保証され、生成的な回答ではなく読解に焦点が当てられる。
SQuADデータセットは、記事を訓練セット、開発セット、テストセットに分割している。テストセットは公開されず、参加者は予測をサーバーに送信してスコアリングを行う。これにより、テストデータに対してオーバーフィッティングすることを防ぎ、早期のニューラルネットワークモデルから最新のトランスフォーマー-ベースのアーキテクチャまで、さまざまなアプローチ間での公正な比較を促進した。
モデル開発への影響
SQuADは、質問応答モデルの急速な進歩に重要な役割を果たした。初期の数年間は、最高の性能を達成するシステムは文脈系列モデルと注意機構に依存しており、スコアは控えめだった。2018年にBERTなどの事前学習型言語モデルが導入されたことで、モデルはSQuAD1.1で人間の性能を超えるまでに大きな改善が見られた。この進歩は、大規模コーパスでの事前学習(現代の大規模言語モデル開発の基盤である)の強力さを示すものとなった。
エンコーダ デコーダ設計やマルチヘッド注意に基づくものなど、後続のアーキテクチャは最先端を押し上げ続けている。SQuAD2.0は、無回答質問があり、より困難であり、モデルは予測された回答に低信頼性スコアを割り当てるなど、代理報酬を組み込む必要があった。本挑戦は、不確実性の推定や頑健な推論に関する研究を促し、これらはまだ活性な研究分野である。
ベンチマークはまた、商業的なAI製品の開発にも影響を与えた。オープンAIやグーグルディープマインドなどの企業は、SQuAD風タスクをモデルの評価と改善に使用しており、このデータセットは学術論文や業界レポートでよく参照される共通点となっている。
評価指標とリーダーボード
SQuADの主要な指標は、正規化なしの完全一致(EM)とF1スコアである。EMは厳密な指標であり、予測された回答が、点数(「a」「an」「the」などの冠詞を除く)や句読記号、ケースを含めて正解と正確に一致することを要求する。F1は回答をトークンの袋とみなし、精度と再現率の加重平均を計算する。重複する単語には部分的なスコアが与えられる。SQuAD1.1での人間の性能は約82.3 EMと91.2 F1である一方、一流モデルは90 EM以上と95 F1を超えるスコアを達成している。SQuAD2.0では、人間の性能は約86.8 EMと89.5 F1であり、最良のモデルはほぼ人間のレベルに達している。
スタンフォードが主催する公式リーダーボードは、時間の経過とともにこれらの指標を記録してきたが、現在の公式リーダーボードは存在しないが、研究論文は自前の表を維持している。このデータセットは、読み取り理解での進捗を測定するために継続的に使用されており、その結果は会議での提出時に定期的に引用されている。
限界点と批判
成功にもかかわらず、SQuADには顕著な限界がある。抽出型の形式は回答をテキスト内のスパンに制約しており、実際のユーザーが問う開放型の全範囲を反映していない。データセットには偏りもあり、質問がエンティティや日付に焦点を置く傾向があり、またクラウドソースされた質問は自然でないことがある。批評家は、高いスコアを達成するモデルは深い理解ではなく、表面的な(質問の単語とコンテキストの単語を合わせるなどの)手がかりに依存することがあると指摘している。
SQuAD2.0は、無回答質問を追加することでいくつかの問題に対処したが、質問ごとに単一のドキュメントを持つクローズドブック設定で動作している。これは、システムが大規模なコーパスから関連情報を検索する必要のあるオープンドメイン質問応答とは大きく異なる。その結果、研究者はマルチホップやオープンドメインの課題を探求するために、Natural QuestionsやHotpotQAなどの代替ベンチマークを開発した。それでもSQuADは、分野において標準的な参照として残っている。
遺産と継続的使用
SQuADの遺産は、基本的なリソースとして拡張されている。それはディープラーニングの概念を教えるための教育ツールとして機能している。データセットは自由に利用可能であり、一般的な機械学習のライブラリや教育プラットフォームに統合されている。その設計原理(大規模な、クラウドソースな質問、明確な評価指標)は、多くの後続データセットに影響を与えた。
2025年時点で、SQuADは引き続き研究で使用されており、特に新しいトランスフォーマーベースのアーキテクチャと組み合わせた研究やモデルの解釈可能性の研究にに使用されています。ジェネレーティブな大規模モデルの台頭によりその支配的な地位は衰えたが、読み取り理解の能力を確認するための価値あるサニティチェックとして残っている。このベンチマークは、AIの歴史におけるその役割は確立されており、10年にわたる進歩を促進し、研究者が自分の研究を比較するための共通の言語を提供してきた。