英語からの翻訳

OPT-175Bは、Metaが公開した1750億パラメータのオープンソース大規模言語モデルであり、2022年に高度なAI研究へのアクセスを民主化する目的でリリースされた。GPT-3と同等の規模を持ちながら、公開された重みとコードを提供し、LLMの挙動のより広範な研究を可能にする。

OPT-175Bは、Meta AIが開発し、2022年5月に公開された大規模言語モデルである。1750億のパラメータを持ち、OpenAIのGPT-3と同等の規模を目指しつつ、研究者に公開された。このモデルの公開には、重み、コード、トレーニングログが含まれており、これは当時の多くのAI研究所の閉鎖的な慣行からの逸脱であった。この透明性は、再現可能な研究と大規模ニューラルネットワークの深い理解を促進することを目的としていた。

OPT-175Bはトランスフォーマーアーキテクチャに基づいて構築されており、具体的には自己回帰型のデコーダーのみの設計である。GPT-3と同様の構造を使用し、96層、96のアテンションヘッド、隠れ次元12,288を持つ。このモデルは、公開されている多様なテキストコーパスでトレーニングされ、合計約1800億トークンに及ぶ。このデータセットには、書籍、ウェブテキスト、その他のソースが含まれ、低品質または重複するコンテンツを除去するためにフィルタリングされた。トレーニングには992台の80GB A100 GPUが使用され、約250万GPU時間を消費した。これは、効率的な並列化技術により、以前のモデルと比較して大幅なコスト削減となった。

トレーニングと最適化

OPT-175Bのトレーニングプロセスでは、その規模を管理するためにいくつかの高度な技術が採用された。MetaはGPUクラスタ全体でデータ、モデル、パイプライン並列化を組み合わせて使用した。また、トレーニングを安定させるために勾配クリッピングを実装し、ウォームアップフェーズとそれに続くコサイン減衰を備えた学習率スケジュールを使用した。モデルはAdamオプティマイザでトレーニングされ、バッチサイズは400万トークンであった。メモリ使用量を削減するため、混合精度トレーニングを使用し、重みをFP16で保存し、オプティマイザの状態にはFP32を使用した。公開されたトレーニングログには、損失スパイクなどの課題とチームの対応が記録されており、大規模トレーニングのダイナミクスに関する貴重な洞察を提供した。

オープンソースの影響

OPT-175Bの公開は、大規模言語モデルの状況における画期的な出来事であった。それ以前は、GPT-3のようなこの規模のモデルは有料APIを通じてのみ利用可能であり、学術研究が制限されていた。オープンな重みを提供することで、Metaは研究者がモデルを直接実行、微調整、調査することを可能にした。これにより、バイアス、毒性、解釈可能性などのトピックに関する研究の波が生まれた。このモデルはまた、BLOOMやLLaMAなどのその後のオープンモデルのベースラインとしても機能し、その教訓を基に構築された。しかし、オープンな公開は悪用の懸念も引き起こし、モデルが説得力のある偽情報やスパムを生成する可能性があった。Metaはこれに対処するため、研究者にアクセス申請を求めたが、重みは依然として典型的なプロプライエタリモデルよりもアクセスしやすかった。

パフォーマンスと評価

標準的なベンチマークでは、OPT-175BはGPT-3と同等のパフォーマンスを示したが、わずかな変動があった。例えば、SuperGLUEスイートでは同様のスコアを達成し、Winograd Schemaなどの一部の推論タスクではわずかな違いを示した。このモデルは少数ショット学習に優れており、わずかな例で新しいタスクに適応するGPT-3の能力に匹敵した。しかし、特定の事実想起に苦労し、時には幻覚情報を生成した。Metaの評価には人間の好みテストも含まれており、OPT-175Bはオープンエンドの生成でGPT-3と競争力があると評価されたが、一部の構造化タスクでは遅れを取った。コード生成におけるパフォーマンスはあまり堅牢ではなく、トレーニングデータにコードコンテンツが限られていることを反映していた。

制限と倫理的考慮事項

他の大規模モデルと同様に、OPT-175Bはトレーニングデータに存在するバイアスを示した。Meta自身の分析では、特に性別、人種、宗教に関して、ステレオタイプ化されたまたは不快なコンテンツを生成する可能性があることが判明した。モデルはまた、フレーズを繰り返す傾向があり、有害なテキストを生成するように簡単にプロンプトされる可能性があった。これらの問題を軽減するため、Metaは詳細なモデルカードを提供し、責任ある使用を奨励した。また、実験を容易にするために、より小さいバージョンのOPT-1.3Bも公開した。このような強力なモデルのオープンソース化に関する倫理的議論は続き、透明性がリスクを上回ると主張する人もいれば、より管理されたアクセスを求める人もいた。2024年現在、OPT-175Bはオープンモデル開発の参照点であり続けているが、新しいモデルがその能力を超えている。

遺産と影響

OPT-175Bは、大規模モデルが壊滅的な結果なしにオープンにできることを実証することで、AI研究の方向性に影響を与えた。これは、Metaのその後のLLaMAシリーズへの道を開き、効率とアクセシビリティをさらに向上させた。このモデルはまた、アクティベーションチェックポイントやテンソル並列化などの効率的なトレーニングと推論の技術開発にも貢献した。その公開トレーニングログは、スケーリングの実践的な課題を理解するための貴重なリソースとなった。今日最も強力なモデルではないが、OPT-175Bは生成AIの歴史において重要な位置を占めており、プロプライエタリシステムが支配する分野におけるオープン性へのシフトを表している。その公開は、AI21 LabsInflection AIなどの他の研究所にオープン戦略を検討するよう促したが、多くは依然としてクローズドなアプローチを選択した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·open-source-ai·meta-ai·transformer
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴