英語からの翻訳

Reuters-21578は、1987年の21,578件のロイター通信記事からなる、古典的なテキスト分類ベンチマークデータセットであり、機械学習や情報検索システムの評価に広く用いられている。複数のカテゴリに整理されたラベル付き文書を含み、自然言語処理研究の標準として機能している。

Reuters-21578は、1987年に公開されたロイター通信社のニュース記事21,578件からなる、古典的なテキスト分類のベンチマークデータセットです。数十年にわたり、機械学習や情報検索アルゴリズムの評価の基盤となってきました。このデータセットは標準的な訓練・テスト分割で配布されており、典型的には「ModApte」分割が用いられます。この分割では、訓練用に9,603文書、テスト用に3,299文書が確保され、複数のトピックを持つ文書やトピックを持たない文書の一部は破棄されます。各記事には、経済指標、企業買収、農産物などの135カテゴリから、1つ以上のトピックラベルが割り当てられています。

このデータセットは、1990年代に研究目的で編纂されたReuters-22173コーパスに由来します。-21578版は、不整合を解消し、よりクリーンで広く採用されるベンチマークを提供するために作成されました。UCI機械学習リポジトリや様々な学術コースのウェブサイトなど、複数のプラットフォームでホストされ、テキスト分類実験の事実上の標準となっています。

歴史的背景と作成

Reuters-21578は、主に1987年のロイター通信社のニュース記事のより大規模なコレクションから派生しました。初期の編纂は、マサチューセッツ大学や他の機関でのプロジェクトの一環であり、情報検索システムを評価するための現実的なコーパスを提供することを目的としていました。完全なデータセットには元々21,000件以上の文書が含まれていましたが、前処理のステップでラベルが欠落または曖昧なものを削除し、現在使用されている21,578件の記事になりました。研究者デビッド・D・ルイスとマーク・リンゲットにちなんで名付けられたModApte分割(技術報告書の著者の頭字語に由来)は、標準的な評価プロトコルとなり、研究間の比較可能性を確保しました。

データセットの構造は典型的な通信社のフォーマットに従い、タイトル、本文、日付や著者などのメタデータを含みますが、ほとんどの評価はトピックラベルが付された本文に焦点を当てています。トピックラベルはロイターの編集者によって手動で割り当てられ、分類タスクのための高品質なグラウンドトゥルースを提供しています。

機械学習におけるベンチマークの役割

Reuters-21578は、テキスト分類のための機械学習の発展に大きく貢献しました。1990年代後半から2000年代にかけての初期の研究では、このデータセットを用いてナイーブベイズ、サポートベクターマシン、決定木などのアルゴリズムが比較されました。例えば、1998年のJoachimsによる画期的な研究では、サポートベクターマシンがこのベンチマークで優れた性能を達成し、トップ10カテゴリでのマイクロ平均F1スコアが約0.86であったのに対し、k近傍法は約0.82、ナイーブベイズは約0.72でした。これらの結果は、高次元テキストデータに対する強力なツールとしてSVMを確立するのに役立ちました。

研究者はまた、カイ二乗統計量や情報利得などの特徴選択技術を探求するためにこのデータセットを使用し、これによりノイズを低減して分類精度が大幅に向上しました。データセットの適度なサイズと明確なラベル構造は、より大規模なコーパスに拡張する前にメソッドを試作するのに理想的でした。

自然言語処理への影響

自然言語処理の広範な分野において、Reuters-21578は初期のニューラルネットワークモデルの標準的な評価を提供しました。トランスフォーマー以前のアーキテクチャ、例えばテキスト用の畳み込みニューラルネットワーク(2014年のキム・ユンによるモデルなど)やリカレントネットワークは、その有効性を示すためにこのデータセットでテストされました。例えば、キムの2014年の文分類用CNNに関する論文では、Reuters-21578でマイクロF1が0.872と報告され、線形カーネルの従来のSVM(0.855)をわずかに上回りました。これは、構造化テキスト分類における深層学習への関心を高めるのに役立ちました。

その後、大規模言語モデルとファインチューニングアプローチの登場に伴い、Reuters-21578は新しいアーキテクチャの迅速な健全性チェックとして残りましたが、その小さなサイズは初期段階の実験に限定されました。このデータセットは、埋め込み技術や転移学習のベンチマークによく使用され、事前学習済みモデルがModApte分割でファインチューニングされます。

データ特性と前処理

データセットには21,578件の記事が含まれますが、すべてが完全なテキストを持つわけではありません。平均文書長は約200語です。ラベルは相互に排他的ではなく、1つの文書が「earn」や「acq」などの複数のカテゴリに属することができます。実際には、多くの研究が各カテゴリの二値分類問題に変換するか、文書の大半をカバーする上位10の頻出カテゴリに焦点を当てます。分布は偏っており、「earn」カテゴリには約3,776件の訓練文書がありますが、多くのカテゴリは10件未満の例しかなく、稀なクラスの分類に課題をもたらします。

前処理は通常、トークン化、小文字化、ストップワード除去、ステミングを含みます。データセットは二値または多ラベル分類タスクとしてよく使用され、精度、再現率、F1スコア(マイクロおよびマクロ平均)などの指標が用いられます。

遺産と継続的な使用

20 NewsgroupsやAG Newsなどの新しいデータセットが登場しましたが、Reuters-21578は基本的なテキスト分類問題を理解するための参照点として残っています。これは、人工知能や情報検索に関する学術コースで、学生に分類器の構築と評価を教えるために頻繁に使用されます。その歴史的重要性は文献で認識されており、テキスト分類の調査で頻繁に引用されています。

2020年代初頭の時点で、このデータセットは研究目的で自由に利用でき、適切な引用が元のソースに対して行われます。また、前処理を追加したバージョンや異なる分割を持つReuters-21578などの派生版にも影響を与えましたが、元のModApte分割が最も一般的なベースラインとして残っています。このベンチマークの長寿は、その品質とラベル付けの明確さを強調しており、再現可能な研究のための耐久性のあるツールとなっています。

参考文献とさらなる読書

研究者は通常、データセットの構築と意図された使用法を説明するデビッド・D・ルイスによる技術報告書「Reuters-21578 Text Categorization Test Collection, Distribution 1.0」(1997年)を引用します。歴史的な視点については、1992年のルイスとリンゲットによる論文が、確率的分類器の文脈でModApte分割を紹介しました。これらの文書は、データセットの出所に関する主要な根拠を提供します。

関連項目

  • Machine learning このデータセットに適用されるアルゴリズムについて。
  • Neural network このデータセットでテストされた深層学習モデルについて。
  • Data Augmentation 分類性能を向上させるために使用されるメソッドについて。

要約すると、Reuters-21578はテキスト分類の分野を形成した基礎的なデータセットであり、安定した十分に文書化されたテストベッドを提供し、現代のNLP研究に情報を与え続けています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:text-categorization·dataset·machine-learning·nlp
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴