英語からの翻訳

GPT-NeoXは、EleutherAIによって開発されたオープンソースの200億パラメータの自己回帰型大規模言語モデルであり、2022年に公開された。当時のオープンモデルの中ではその規模で注目され、効率的な訓練実装でも知られている。

GPT-NeoXは、研究集団EleutherAIによって開発されたオープンソースの大規模言語モデルである。2022年2月に公開され、200億パラメータを持つ自己回帰型トランスフォーマーモデルであり、公開時点で完全にオープンソースの言語モデルとしては最大級のものの一つである。このモデルは、プロプライエタリなシステムに代わる公開アクセス可能な選択肢を提供することで人工知能の研究を進展させることを目的として設計され、重み、学習コード、評価の詳細が自由に利用可能となっている。GPT-NeoXは初期のGPT-Neoシリーズを基盤とし、アーキテクチャと学習技術をスケールアップして、さまざまな自然言語タスクでの性能を向上させている。

このモデルのアーキテクチャは標準的なデコーダーのみのトランスフォーマー設計に従い、マルチヘッドアテンション位置エンコーディング層正規化を組み込んでいる。44層のスタック全体で残差ネットワーク接続を使用し、隠れ次元は6144、アテンションヘッドは32個である。モデルは、ウェブクロール、書籍、学術論文から収集された多様なテキストコーパスで学習され、データ総量は約825ギガバイトに及ぶ。学習は96基のNVIDIA A100 GPUクラスター上でMegatron-DeepSpeedフレームワークを使用して実施され、これにより効率的なモデル枝刈りと複数ノードにわたる並列化が可能となった。学習プロセスは約2か月かかり、推定1.1エクサフロップスの計算量を消費した。

学習と最適化

GPT-NeoXは、大規模での学習を安定させるためにいくつかの高度な機械学習技術を採用した。モデルは勾配クリッピングを使用して勾配爆発を防ぎ、ウォームアップフェーズとそれに続くコサイン減衰を備えた学習率スケジュールを採用した。重み初期化は、初期のトランスフォーマーモデルの慣行に従い、スケールされた分散を持つ正規分布を使用して実行された。学習目的は標準的な因果言語モデリングであり、先行する文脈に基づいて次のトークンを予測するものである。効率を向上させるため、チームはシーケンス間バッチ処理を実装し、パラメータ更新にはAdamオプティマイザーSGD変種を使用した。モデルはまた、正則化のためにドロップアウトを組み込んでいるが、容量を維持するためにより小さなモデルよりも低い率で使用されている。

能力と性能

GPT-NeoXは、LAMBADA、HellaSwag、SuperGLUEなどのベンチマークで強い性能を示し、完全にオープンではない同規模のモデルに匹敵またはそれを上回ることが多い。長距離依存関係を必要とする深層学習タスク、例えばストーリー生成やオープンエンドの質問応答で優れている。モデルは、制御されたテキスト生成のためにtop-kサンプリングtop-pサンプリング温度スケーリングをサポートしており、ユーザーは創造性と決定性を調整できる。200億パラメータの規模により、ニュアンスのあるニューラルネットワーク表現が可能になるが、推論にはかなりの計算リソースが必要であり、通常は複数の高性能GPUが必要となる。モデルは1.3Bおよび2.7Bのバリアントを含む複数のサイズで利用可能だが、20Bバージョンが主力製品である。

影響とエコシステム

GPT-NeoXは、オープンソースの生成AIコミュニティに大きな影響を与えてきた。これはGPT-JやGPT-NeoX-20B派生モデルを含む後続モデルの基盤として機能し、他の組織が大規模なオープンモデルを公開する取り組みに影響を与えた。学習コードとインフラストラクチャは広く再利用され、EleutherAI Evaluation Harnessなどのツールの開発に貢献している。モデルの公開はまた、大規模モデルの学習における環境コストと、AI研究における透明性の重要性についての議論を引き起こした。これはしばしばOpenAIAnthropicのプロプライエタリモデルと比較されるが、それらの最大の提供物よりも小規模である。

制限と倫理的考慮事項

多くの大規模言語モデルと同様に、GPT-NeoXは学習データに存在するバイアスを反映して、偏ったまたは有害なコンテンツを生成する可能性がある。組み込みの安全フィルターはなく、ユーザーは追加のモデレーションを適用することが推奨される。モデルのサイズは消費者向けハードウェアでの展開を非現実的にし、資金のある機関へのアクセスを制限している。EleutherAIは、このモデルが研究用の成果物であり、本番システムではないことを強調し、責任ある使用を奨励している。学習データには著作権で保護された素材が含まれており、フェアユースに関する法的問題を提起しているが、モデルはApache 2.0ライセンスの下で公開されており、広範な下流での使用が許可されている。

入手方法と使用法

GPT-NeoXは、Hugging FaceおよびEleutherAIのGitHubリポジトリからダウンロード可能である。モデルは、Transformersライブラリまたは元のMegatron-DeepSpeedコードベースを使用して実行できる。開発者にとっては、性能とアクセシビリティのバランスを提供し、コミュニティ作成の量子化バージョンがメモリ要件を削減している。モデルは、解釈可能性、カリキュラム学習RLHFに関する学術研究で使用され、新しいアーキテクチャを評価するためのベースラインとして機能している。そのオープンな性質により、専門分野へのファインチューニングが可能であり、機械学習実践者にとって多用途なツールとなっている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·open-source-ai·transformer·eleutherai
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴