SST Binaryは、自然言語処理におけるバイナリ感情分類のための広く使用されるベンチマークデータセットです。これは、2013年にスタンフォード大学の研究者(リチャード・ソーチャーやクリストファー・マニングを含む)によって導入されたスタンフォード感情ツリーバンク(SST)のサブセットです。SSTは元々、映画レビュー内のフレーズに対して細かい感情ラベル(非常に否定的、否定的、中立的、肯定的、非常に肯定的)を提供するように設計されていましたが、バイナリ版はこれらを肯定的と否定的の2つのクラスにまとめます。この単純化により、SST Binaryは感情分析における機械学習モデル、特に文レベルやフレーズレベルの極性を扱うモデルを評価するための標準的なテストベッドとなっています。
このデータセットは、映画レビューから抽出された6,920の単文で構成され、それぞれが肯定的または否定的のいずれかにラベル付けされています。元のSSTにはフレーズレベルのアノテーションも含まれていますが、SST Binaryは通常、文レベルのバイナリスプリットを指します。訓練、開発、テストの分割は事前に定義されており、合計6,920文が含まれます。標準的な分割では、6,920文が訓練用、872文が開発用、1,821文がテスト用に分けられます(これらの数値は概算であり、リリースによってわずかに異なります)。バイナリラベルは、細かいバージョンから中立的な例を除外し、明確に肯定的または否定的な文のみを残すことで導出されます。
構築とアノテーション
SSTは、スタンフォード感情ツリーバンクコーパスから構築されました。このコーパス自体は、2005年にパンとリーによって収集された映画レビューデータセットから派生したものです。元のレビューは、スタンフォードパーサーを使用して各文のツリー構造を作成し、ツリー内のすべてのノードに感情ラベルが割り当てられました。バイナリ版では、ルートノード(文全体)のみが使用され、ラベルはバイナリ化されます。細かいラベルの「肯定的」と「非常に肯定的」は「肯定的」になり、「否定的」と「非常に否定的」は「否定的」になります。中立的なラベルは除外され、肯定的と否定的な文がほぼ同数となるバランスの取れたデータセットが得られます。
機械学習での使用
SST Binaryは、Machine learningおよびDeep learningコミュニティにおける標準的なベンチマークとなっています。これは、リカレントネットワーク、畳み込みネットワーク、そして最近ではTransformer (architecture)ベースのモデルを含むNeural networkモデルの性能を比較するためによく使用されます。このデータセットは比較的小規模であり、限られたデータ条件下でのモデルテストに役立ちます。多くの論文がSST Binaryでの精度を主要な指標として報告しており、2020年代初頭の時点で最先端のモデルは約95%の精度を達成しています。このデータセットは転移学習の研究でも使用され、より大規模なコーパスで事前学習されたモデルがSST Binaryで微調整され、感情理解を評価します。
他のデータセットとの関係
SST Binaryは、IMDBレビューやYelp極性などの他の感情データセットとよく比較されます。より長いドキュメントを含むIMDBとは異なり、SST Binaryは単文に焦点を当てており、言語理解のより細かいテストとなっています。5つのクラスを持つ細かいSSTも使用されますが、より単純なタスクにはバイナリ版が好まれます。このデータセットは、Hugging Faceのデータセットなどの人気のあるNLPライブラリに含まれており、Natural language processingに関するチュートリアルや研究論文で頻繁に使用されています(注:提供されたスラッグリストにはないため、リンクは避けてください)。
制限と批判
SST Binaryの1つの制限は、その小規模さであり、大規模なモデルをゼロから訓練する際に過学習を引き起こす可能性があります。さらに、バイナリラベルは中立的な感情を破棄するため、現実世界の曖昧さを反映しない場合があります。一部の研究者は、このデータセットには映画レビューからのドメイン固有の言語が含まれており、他のドメインへの一般化を制限する可能性があると指摘しています。これらの問題にもかかわらず、SST Binaryは感情分類のための信頼性が高く、広く引用されるベンチマークであり続けています。
関連項目
- Stanford AI Lab - データセットが作成されたラボ。
- Deep learning - このデータセットを評価に頻繁に使用する分野。
- Transformer (architecture) - SST Binaryでよくテストされるモデルアーキテクチャ。
- Large language model - このベンチマークで評価される現代のモデル。