GLM-130Bは、清華大学の研究者によって開発され、2022年に公開された大規模言語モデルである。1300億のパラメータを持ち、英語と中国語の両方をサポートするオープンソースのバイリンガルモデルとして設計されており、当時の多くのモデルがクローズドソースまたは英語中心であったのとは対照的である。このモデルは、Transformer (architecture)ベースのEncoder-Decoder Architecture設計と自己回帰生成の側面を組み合わせたGeneral Language Model(GLM)アーキテクチャに基づいており、理解タスクと生成タスクの両方を効果的に処理できる。
このプロジェクトは、専有の大規模言語モデルと公開されている代替モデルとの間のギャップを埋めるために開始された。モデルの重みとトレーニングコードを公開することで、開発者は研究コミュニティに、特に多言語コンテキストでのLarge language modelの能力を研究・発展させるための強力なツールを提供することを目指した。GLM-130Bは、英語と中国語の多様なコーパスでトレーニングされ、その性能は、OpenAIのGPT-3や他の大規模システムを含む、当時のいくつかの著名なモデルとベンチマーク比較された。
アーキテクチャとトレーニング
GLM-130Bは、理解タスク用の双方向アテンション機構と、生成用の単方向・自己回帰コンポーネントを統合した独自のアーキテクチャを採用している。GLMフレームワークで詳述されているこのハイブリッドアプローチにより、モデルはテキスト分類、質問応答、要約などのタスクで優れた性能を発揮し、一貫性のある文脈に関連したテキストを生成できる。モデルはMulti-Head Attention機構を使用し、Layer NormalizationとResidual Network (ResNet)接続を組み込んで、トレーニングの安定性と勾配の流れを改善している。
トレーニングは大規模なGPUクラスターで実施され、Gradient ClippingやLearning Rate Schedulingなどの技術を用いて収束を確保した。モデルは英語と中国語のデータを混合してトレーニングされ、両言語を効率的に処理するように設計されたトークナイザーが使用された。トレーニングプロセスでは、Model Pruningやその他の最適化戦略も採用され、メモリフットプリントを削減し、推論速度を向上させて、標準的なハードウェアでの展開を容易にした。
性能と評価
ベンチマーク評価では、GLM-130Bは他の大規模モデルと比較して競争力のある性能を示し、特に中国語タスクでは、主に英語データでトレーニングされたモデルを上回ることが多かった。LAMBADAやMMLUなどの英語ベンチマークでは、一部の競合他社よりもパラメータ数が少ないにもかかわらず、GPT-3と同等またはそれを超える結果を達成した。モデルのバイリンガル能力は、クロスリンガルタスクで強調され、強い転移学習能力を示した。
しかし、モデルは当時の大規模言語モデルに共通する限界も示し、時折の事実誤認やプロンプトの言い回しに対する感度が含まれた。開発者は、Google DeepMindのChinchillaやAnthropicのClaudeなどのモデルとの比較を含む詳細な評価結果を公開し、その強みと弱みについて透明性を提供した。
オープンソースの影響
GLM-130Bの最も重要な貢献の一つは、そのオープンソース性である。多くの主要モデルが専有であった時代に、GLM-130Bは研究者に最先端のモデルへのアクセスを提供し、解釈可能性、ファインチューニング、安全性に関する研究を可能にした。リリースにはモデルの重みだけでなく、トレーニングコードと詳細なドキュメントも含まれており、モデルを基に様々なアプリケーションを構築する開発者のコミュニティを育成した。
モデルのリリースはまた、Artificial intelligenceの民主化と、この分野におけるオープンリサーチの重要性についての議論を促進した。これは、その後のGLMバリアントの基盤となり、より大規模で効率的なモデルを含み、Machine learningとDeep learningにおける他のオープンソースイニシアチブの開発に影響を与えた。
限界と倫理的考慮事項
他の大規模言語モデルと同様に、GLM-130Bはバイアス、誤情報、潜在的な悪用に関連する倫理的懸念を引き起こす。インターネットから取得されたトレーニングデータには、モデルが増幅する可能性のあるバイアスが含まれている可能性がある。開発者はこれらの問題を認識し、モデルの出力が重大な結果をもたらす可能性のあるアプリケーションでは、人間の監督を含む慎重な使用を推奨した。また、責任ある展開のためのガイドラインを提供し、透明性と説明責任の重要性を強調した。
技術的な限界には、比較的大きなメモリフットプリントが含まれ、推論にはかなりの計算リソースが必要であった。モデルの英語と中国語以外の言語での性能は限られており、トレーニングデータの焦点を反映していた。リリース時点で、GLM-130BはオープンソースAIにおける重要な前進を表していたが、強力かつ安全なモデルを作成する上での継続的な課題も浮き彫りにした。
遺産と影響
GLM-130Bの開発は、オープンソースの大規模言語モデルの広範なトレンドに貢献し、LLaMAなどのその後のプロジェクトに影響を与えた。そのアーキテクチャとトレーニング方法論は多くの研究論文で引用され、そのバイリンガル能力は他の言語での同様の取り組みに影響を与えた。モデルは、Neural networkモデルのスケーリング則と、モデルサイズ、データ、性能の間のトレードオフを研究する研究者にとっての参照点であり続けている。
2024年現在、GLM-130Bは利用可能な最大または最先端のモデルではないが、その分野への影響は永続的である。高品質のオープンソースモデルが専有モデルに対抗できることを実証し、AI研究へのより包括的で協力的なアプローチへの道を開いた。