MS MARCO(Microsoft Machine Reading Comprehension)は、2016年にマイクロソフトが機械読解とパッセージランキングタスクのために導入した大規模データセットである。このデータセットは、Bing検索エンジンのログからの実際のユーザークエリに加え、ウェブ文書からの関連パッセージと人間が生成した自然言語の回答を提供することで、初期の質問応答ベンチマークの限界に対処するよう設計された。その作成と公開により、研究者はテキストを大規模に取得・解釈するシステムを開発・評価できるようになり、従来の情報検索とディープラーニングベースの理解モデルとの間のギャップを埋めた。
MS MARCOの各サンプルは、実際のユーザークエリ、関連性が判定されたパッセージのセット、および(サンプルの一部について)人間が書いた回答で構成される。元の質問応答タスクには10万件以上のクエリが含まれ、パッセージランキング用のより大規模なバージョンも存在する。公開データには、クラウドソーシングを通じて生成された関連性ラベルが含まれ、回答は人間の注釈者によって書かれた。MS MARCOは、パッセージの再ランキング、機械読解、オープンドメイン質問応答などのタスクにおける標準的なベンチマークとして広く使用されている。
データセット構造
元のMS MARCOデータセットは、必要な回答のタイプに基づいてクエリをエンティティ、数値、パッセージ形式の質問の3つの主要カテゴリに整理する。パッセージランキングタスクでは、データセットは負の例(関連性のないパッセージ)と、人間の注釈者による判定に基づく正のラベルを提供する。データセットはトレーニング、検証、テストセットに分割される。時間の経過とともに、マイクロソフトは会話検索サブセット(MS MARCO ConvSearch)やより大規模なパッセージランキングコレクションを含む、複数のバージョンと派生タスクをリリースした。実際の検索ログから得られたデータセットの規模と現実性は、初期の合成データセットとは異なる特徴を持つ。
ベンチマークタスク
MS MARCOは、いくつかの標準的な評価タスクを導入した。主要なタスクは、パッセージの再ランキングであり、モデルは人間のラベルを使用して、取得されたパッセージのセットをクエリへの関連性に基づいて順序付ける必要がある。2番目の主要タスクは、機械読解(MaRC)であり、モデルは単一の関連パッセージを読み、正確な回答(スパン)を生成するか、抽象的な流暢な回答を生成する。その後、全文パラグラフランキングタスクと、追加のコンテキストを使用した質問応答も含まれた。パフォーマンスは通常、MRR(平均逆順位)、nDCG(正規化割引累積利得)、再現率などの指標を使用して測定される。このベンチマークは、トランスフォーマーベースの検索システムにおける顕著な進歩を引き出してきた。
アプリケーションと影響
MS MARCOは、ニューラル検索モデルの開発における基盤リソースとなった。これは、MIT CSailやスタンフォードAIラボなどの大学、およびGoogle DeepMindやAnthropicなどの産業研究所を含む主要な研究グループによって頻繁に使用され、大規模言語モデルや密検索システムの微調整に利用された。このデータセットを使用して開発された高度なモデルは、検索エンジンや会話型アシスタントの設計に影響を与え、語彙ベースのマッチングから意味的埋め込みやニューラル再ランキングパイプラインへと移行させた。データセットの成功は、TREC(テキスト検索会議)トラックへの統合にもつながり、公式の評価柱となった。
継続的な関連性
MS MARCOは、ColBERTなどのマルチベクターモデルのトレーニング用にパッセージとドキュメントベクターを提供するドキュメントランキング用のMS MARCOなど、現代のベンチマークの先駆けとしても機能してきた。2024年時点で、このデータセットは密検索と読解の両方における新しい技術を評価するための広く引用され、一般的に使用されるベンチマークであり続けている。トランスフォーマーアーキテクチャや事前学習手法を使用する多くの現代の検索システムは、リーダーボード上でMS MARCOに対して評価されている。その現実世界に基づく基盤は、ドメインシフト、データ非効率性、少数ショット学習に関する研究を引き続き支援している。
関連プロンプト
データセットの設計原則は、OpenAIやAnthropicなどの企業の研究チームが作成した他の大規模リソースと一致しているが、これらは生成的タスクに焦点を当てている。パッセージと質問応答への関連性は、ニューラルネットワークトレーニング、Azureインフラストラクチャのトピックと重複しており、またAmazonページから従業員[省略]のロボット工学によってオープンソース化されている。