英語からの翻訳

AG News是一个大规模新闻文章分类数据集,包含超过120,000条英文新闻标题和描述,用于机器学习中文本分类算法的基准测试。

AG Newsは、ニュース記事の分類に広く使用されるベンチマークデータセットである。このデータセットには、12万件以上の英語のニュース見出しと短い説明文が含まれており、それぞれが「ワールド」「スポーツ」「ビジネス」「科学・技術」の4つのクラスのいずれかに割り当てられている。このデータセットは、学術検索エンジンであるAG's Corpusによって収集された大規模なニュース記事コーパスから派生したものであり、機械学習および自然言語処理におけるテキスト分類モデルの評価のための標準的なテストベッドとなっている。

このデータセットは、その単純さと規模で知られており、テキスト分類への深層学習アプローチを探求する研究者や実務者にとって一般的な出発点となっている。各サンプルはタイトルと説明文で構成され、クラスラベルがトピックを示す。4つのクラスはバランスが取れており、各クラスにつき約3万件のトレーニング例と1,900件のテスト例があり、モデルのパフォーマンスを信頼性高く測定できる。

歴史と起源

AG Newsデータセットは、2015年にニューヨーク大学のXiang Zhangらによる研究プロジェクトの一環として導入された。研究者らは、2,000以上のニュースソースから収集された100万件以上のニュース記事を含むAG's Corpusから記事を抽出し、4つのカテゴリのいずれかに該当する記事を選択して、分類タスク用のバランスの取れたサブセットを構築した。このデータセットは、DBpediaやYahoo! Answersなどの類似のベンチマークとともに公開され、テキスト分類アルゴリズムに多様な課題を提供することを目的としていた。

AG Newsの作成は、ニューラルネットワークモデルをトレーニングおよび評価するための、大規模でクリーンかつ公開されたデータセットの必要性によって動機づけられた。当時、既存のデータセットの多くは小規模であるか、かなりの前処理を必要とした。AG Newsは、明確なラベルを持つ単純な分類タスクを提供し、研究者がデータクリーニングではなくモデルアーキテクチャとトレーニング技術に集中できるようにした。

データセット構造

AG Newsには、トレーニング用とテスト用の2つのファイルが含まれている。トレーニングセットには12万件のサンプルが含まれ、テストセットには7,600件のサンプルが含まれる。各サンプルは、クラスインデックス(1から4)、タイトル、説明文の3つのフィールドを持つCSV行である。クラスインデックスは、それぞれワールド、スポーツ、ビジネス、科学・技術に対応する。タイトルは通常短く、10語未満であることが多く、説明文は1文または2文で、見出しの文脈を提供する。

このデータセットは、句読点を削除し、すべてのテキストを小文字に変換するように前処理されているが、元の大文字と句読点は生のバージョンで利用可能である。この前処理によりトークン化が簡素化され、モデルが書式ではなく単語パターンに焦点を当てることができる。バランスの取れたクラス分布により、ランダムな推測では25%の精度になるため、精度は意味のある指標となる。

機械学習における応用

AG Newsは、サポートベクターマシンやロジスティック回帰などの伝統的な手法から、現代のトランスフォーマーベースのアーキテクチャまで、テキスト分類モデルのベンチマークとして頻繁に使用される。これは新しいモデル設計の健全性チェックとして機能し、AG Newsで高い精度を達成することは、モデルがテキストの基本的な意味的および構文的パターンを捉えられることを示す。

大規模言語モデルの時代において、AG Newsはファインチューニングと評価によく使用される。BERTやGPTなどのモデルは、テストセットでほぼ完璧な精度を達成でき、テキスト分類の成熟度を示している。しかし、このデータセットは教育目的や、特にリソースが制約された環境での異なるアーキテクチャの効率比較において依然として価値がある。

研究者はまた、転移学習、ドメイン適応、データ拡張技術の研究にもAG Newsを使用する。その単純さにより制御された実験が可能であり、その規模により過度な計算コストなしでトレーニングをサポートする。その結果、AG Newsは数百の学術論文に登場し、機械学習コースの定番となっている。

制限と批判

その人気にもかかわらず、AG Newsには制限がある。4つのカテゴリは広範であり、一部の記事は誤ってラベル付けされたり曖昧であったりして、ラベルにノイズが生じる可能性がある。また、このデータセットは比較的古く、2000年代初頭の記事が含まれているため、現在のニュースの傾向や語彙を反映していない可能性がある。さらに、前処理により句読点が削除されテキストが小文字化されるため、実際のアプリケーションで関連する可能性のある文体の違いが隠されることがある。

もう1つの批判は、AG Newsが現代のモデルにとって簡単すぎることであり、多くのモデルが90%以上の精度を達成している。これにより、一部の研究者は、より細かいカテゴリや不均衡なクラス分布を持つものなど、より挑戦的なベンチマークを求めるようになった。それでも、AG Newsは有用なベースラインであり、テキスト分類を理解するための出発点であり続けている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·text-classification·machine-learning·natural-language-processing
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴