GPT-1のリリース

英語からの翻訳

2018年6月にOpenAIによって導入されたGPT-1は、最初の生成的事前学習トランスフォーマーであり、トランスフォーマーアーキテクチャとラベルなしテキストでの事前学習を用いた大規模言語モデルで、自然言語処理における画期的な進歩を示しました。

GPT-1は、2018年6月11日にOpenAIが公開した、最初の生成的プレトレーニング済みトランスフォーマー(GPT)であり、Transformer (architecture)アーキテクチャに基づく大規模言語モデルの一種である。これは、ラベルなしテキストでの生成的プレトレーニングと、特定の言語タスクのための識別的ファインチューニングを組み合わせた半教師ありアプローチを導入し、自然言語処理人工知能の分野を大幅に前進させた。

背景

2010年代には、機械学習アルゴリズムの改善、より強力なコンピュータ、そしてデジタル化されたデータの増加によって牽引されたAIブームが、AIの急速な進歩を可能にした。生成的プレトレーニングは、自己教師あり学習の一形態であり、機械学習において長く確立されていた手法である。モデルはまず大規模なラベルなしデータセットで訓練され、データを生成することを学習し、その後、ラベル付きデータで特定のタスクに適応される。2017年の論文「Attention Is All You Need」でGoogleの研究者らが導入したトランスフォーマーアーキテクチャは、注意機構を使用してシーケンス全体を一度に処理することで、従来の再帰型ニューラルネットワークの性能問題を解決し、はるかに大規模で洗練されたモデルを可能にした。

歴史

2018年6月11日、OpenAIは論文「Improving Language Understanding by Generative Pre-Training」を公開し、GPT-1を導入した。これは、デコーダ部分のみを使用したトランスフォーマーベースのモデルであり、多様なテキストコーパスであるBookCorpusでプレトレーニングされ、次のトークンを予測し、その後、特定のタスクのために識別的ファインチューニングが行われた。この半教師ありアプローチは画期的であり、それまでの最高性能のニューラルモデルは、手動でラベル付けされたデータからの高価な教師あり学習に依存していた。2019年2月14日、OpenAIはGPT-2を公開した。これは、15億のパラメータと800万のウェブページからなる40ギガバイトのデータセットを持つ直接的なスケールアップであり、悪用の懸念から当初は段階的に公開された。2020年2月10日、Microsoftは170億のパラメータを持つTuring Natural Language Generationを導入し、当時最大の言語モデルであると主張した。2020年5月28日、OpenAIは1750億のパラメータを持つGPT-3を公開し、少数ショットおよびゼロショット学習を前進させた。GPT-3に続いて、OpenAIは人間のフィードバックからの強化学習を使用してInstructGPTを作成し、2022年11月30日にGPT-3.5に基づくChatGPT、その後GPT-4(2023年3月14日公開)につながった。ChatGPTの人気は、GoogleのPaLMやGemini、Meta AIのLlamaなどの競合他社を刺激した。

基盤モデル

基盤モデルは、広範なデータで大規模に訓練され、多くの下流タスクに適応可能なAIモデルである。基盤となるGPTは、テキスト以外にも画像や音声などのモダリティを採用できる。一部の生成的トランスフォーマーベースのモデルは、拡散や並列デコードなどのテキストから画像への技術に使用され、画像処理システムを開発するための視覚的基盤モデルとして機能している。

効率的なトランスフォーマーアーキテクチャ

トランスフォーマーモデルの計算およびメモリ要件は、サイズと入力長が増加するにつれて大幅に増加する。標準的な自己注意は二次複雑性を持つためである。研究者らは、コストを削減し、より長いコンテキストウィンドウをサポートするために、スパース注意機構やメモリ効率の高いアーキテクチャなどの効率改善を提案した。BigBird、Reformer、FlashAttentionなどのモデルは、構造化された注意パターンや最適化された計算を示し、大規模言語モデルが長いシーケンスを効率的に処理するのに役立っている。

影響

GPT-1の導入は、その後のGPTモデルの基盤を確立し、生成的AIのより広範な発展に影響を与えた。その半教師ありアプローチは、ラベル付きデータへの依存を減らし、膨大なラベルなしコーパスでの訓練を可能にした。GPT-1とその後継モデルの成功は、チャットボットからコンテンツ生成まで、さまざまなアプリケーションでのトランスフォーマーベースのモデルの広範な採用につながり、モデルのスケーリング、アラインメント、効率性に関する研究を促進した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·machine-learning·natural-language-processing·openai
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴