英語からの翻訳

FastTextは、Facebook AI Research(2016年)によるオープンソースライブラリで、サブワード単位による単語表現の学習と効率的なテキスト分類を目的とし、2024年3月にGitHub上でアーカイブされた。

FastTextは、Facebook AI Research(FAIR)が開発した、単語表現の学習とテキスト分類を行うためのオープンソースライブラリである。2016年に公開された。このライブラリは、機械学習技術と計算効率への重点を組み合わせており、大規模な自然言語処理タスクに適している。そのGitHubリポジトリは2024年3月19日にアーカイブされ、活発な開発の終了を示しているが、ソースコードと事前学習済みモデルは引き続き利用可能である。

単語表現

FastTextは、word2vecで使用されるスキップグラムモデルに基づいているが、単語の内部構造も考慮に入れている。各単語を全体としてのみ表現するのではなく、文字n-gramを使用して単語を表現する。文字列を共有する単語は、学習された情報の一部を共有できる。

このサブワード情報の使用は、稀な単語や複雑な語形成を持つ言語に特に有用であり、fastTextがトレーニング中に見られなかった単語の表現を構築することも可能にする。Facebook AI Researchは後に、多くの言語向けの事前学習済みfastTextベクトルを公開し、Common CrawlとWikipediaでトレーニングされた157言語分のコレクションを含む。これらのベクトルは、機械学習分類器や意味的類似性タスクなどの下流アプリケーションで広く採用されている。

テキスト分類

FastTextは、教師ありテキスト分類にも使用できる。テキスト内の単語と単語n-gramからの情報を組み合わせて、クラスラベルを予測する。この手法は計算効率が高くなるように設計されており、元の評価では、トレーニングと予測がはるかに高速でありながら、当時のいくつかの深層学習モデルに匹敵する精度を達成した。教師ありモードでは、階層的ソフトマックスを使用して大規模なラベルセットを効率的に処理し、感情分析や文書タグ付けなどのタスクに実用的である。

アーキテクチャとトレーニング

コアモデルは、単一の隠れ層を持つ浅いニューラルネットワークであり、現代の深層学習で一般的なより深いアーキテクチャとは対照的である。教師なしモードでは、各単語はその文字n-gramベクトルの合計に、オプションの単語全体ベクトルを加えたものとして表現される。教師ありモードでは、入力テキストはその単語ベクトルの平均として埋め込まれ、線形分類器に渡される。トレーニングは、確率的勾配降下法と負例サンプリングを使用して実行され、計算コストを削減する。この単純さにより、fastTextは単一マシン上で数十億の単語を数分で処理できる。

遺産と影響

FastTextは、その後のテキスト表現と分類の発展、特に計算リソースが限られたシナリオに影響を与えた。そのサブワードアプローチは、形態的に豊かな言語や語彙外の処理に関する研究に情報を提供し、大規模言語モデルなどのより複雑なモデルを評価するための一般的なベースラインであり続けている。アーカイブされたリポジトリと公開された事前学習済みベクトルは、学界や産業界の研究者や実務者によって引き続き使用されており、Amazon Web ServicesGoogle Cloudなどのクラウドプラットフォーム内のカスタム人工知能パイプラインでも利用されている。

関連項目

  • Word2vec(関連概念、提供リストにはないがテキストとして言及)
  • Word2vec
  • GloVe
  • ニューラルネットワーク(機械学習)
  • 自然言語処理
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·natural-language-processing·open-source-software·text-classification
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴