GPT-NeoXは、研究集団EleutherAIによって開発された、200億パラメータの大規模言語モデルである。2022年2月に公開され、深層学習と生成AIの研究を進めるために設計された、オープンソースの自己回帰型Transformer (architecture)モデルである。このモデルは、商用システムに代わる公開アクセス可能な選択肢を提供し、研究者が商業的制約なしに大規模なニューラルネットワークを研究できるようにするために作成された。
GPT-NeoXは、初期のGPTモデルのアーキテクチャ原理に基づいており、デコーダーのみのトランスフォーマーとマルチヘッドアテンション、残差接続を使用している。そのトレーニングには、ウェブテキスト、書籍、その他のソースからなる多様なコーパスが使用され、一般化を向上させるために広範なカバレッジが重視された。このモデルの200億パラメータは、大規模言語モデルの中では中規模のカテゴリに位置し、計算コストとパフォーマンスのバランスを取っている。
アーキテクチャと設計
このモデルは、安定性と効率性を高めるためのいくつかの拡張を備えた標準的なトランスフォーマーアーキテクチャを採用している。各サブレイヤーの前に適用されるレイヤー正規化を使用しており、これはトレーニングの収束を改善する手法である。位置エンコーディングは学習され、モデルがトークンの順序を捉えることを可能にする。アテンションメカニズムはマルチヘッドアテンションで実装され、200億のパラメータが64層と各層16のアテンションヘッドに分割されている。
GPT-NeoXは、トレーニング中の勾配爆発を防ぐための勾配クリッピングを組み込んでおり、オプティマイザーとしてAdamを、学習率スケジュール(ウォームアップとコサイン減衰を含む)を使用している。モデルの隠れサイズは6144で、フィードフォワード層は24,576次元に拡張される。これらの選択は、モデル容量とメモリフットプリントのバランスを反映しており、Amazon Web Servicesクラスターでのトレーニングを可能にしている。
トレーニングデータとプロセス
EleutherAIは、GPT-NeoXをThe Pileと呼ばれる厳選されたデータセットでトレーニングした。これは、22の多様なソースから収集された大規模な英語コーパスである。これには、学術論文、書籍、ウェブページ、コードリポジトリが含まれ、合計で約800ギガバイトのテキストになる。トレーニングプロセスでは、各2048トークンからなる512シーケンスのバッチサイズが使用され、約40万ステップ実行された。総計算量は1.2エクサフロップスと推定され、96基のNVIDIA A100 GPUのクラスターで実行された。
トレーニングでは、ロバスト性を向上させるために、ランダムマスキングやトークンドロップアウトなどのデータ拡張技術が採用された。大規模なモデルサイズを処理するために、EleutherAIはGPU間でモデル並列処理を使用し、メモリ制約内に収まるようにレイヤーとアテンションヘッドを分割した。最終チェックポイントはオープンライセンスで公開され、研究および商用アプリケーションでの無制限の使用が可能になった。
パフォーマンスと評価
GPT-NeoXは、言語モデリングのパープレキシティ、質問応答、常識推論タスクなど、さまざまなベンチマークで評価された。LAMBADAデータセットでは、パープレキシティ3.99を達成し、強力な次単語予測を示した。ゼロショット設定では、同規模のモデルと競争力のあるパフォーマンスを発揮したが、OpenAIやGoogle DeepMindなどの大規模なプロプライエタリモデルには及ばなかった。
このモデルは、トレーニングデータにGitHubコードが含まれていることから、コード生成タスクで特に強みを示した。HumanEvalベンチマークでは、pass@1スコア6.4%を達成し、機能するコードを生成する中程度の能力を示した。機械学習ベンチマークでのパフォーマンスは、結果をコミュニティが独立して検証できるため、オープンソースモデルが再現可能な研究を可能にする価値を浮き彫りにした。
影響と遺産
GPT-NeoXは、その後のオープンソースの取り組みの基盤モデルとして機能し、LLaMAやFalconなどの後続モデルの開発に影響を与えた。その公開は、ハイクオリティな大規模言語モデルが非商業組織によってトレーニング可能であることを実証し、テクノロジー大手の支配に挑戦した。このモデルのオープンウェイトは、人工知能の安全性、解釈可能性、ファインチューニングの研究を促進し、多くの研究がこれをベースラインとして使用した。
このプロジェクトはまた、オープンモデルのベンチマークテストを標準化したEleutherAI評価ハーネスの開発など、オープンAIツールのより広範なエコシステムに貢献した。GPT-NeoXのアーキテクチャとトレーニングレシピは詳細に文書化され、他の人が複製および拡張するための青写真を提供した。その遺産は、EleutherAIや他のグループによるその後のリリースに見られるように、透明でアクセスしやすいAI研究を推進する継続的な取り組みに今も生き続けている。
制限と考慮事項
その能力にもかかわらず、GPT-NeoXには顕著な制限がある。その200億パラメータは、多くの現代のモデルよりも小さく、複雑な推論タスクでのパフォーマンスが低い。このモデルは、トレーニングデータのバイアスを反映して、偏ったまたは有害な出力を生成する可能性がある。また、商用システムで使用されるファインチューニングやアライメント技術が欠如しており、追加の安全策なしにユーザー向けアプリケーションに直接展開するのには適していない。
GPT-NeoXを使用する研究者は、推論とファインチューニングにかなりの計算リソースが必要であることを考慮する必要がある。このモデルのメモリフットプリントは、一般的なコンシューマーハードウェアの容量を超えており、クラウドインフラストラクチャまたは専用アクセラレータが必要である。これらの要因により、その主な用途は本番システムではなく研究ツールとしてのものとなっているが、大規模なTransformer (architecture)の研究のための貴重なリソースであり続けている。