英語からの翻訳

CPM-2は、北京人工智能研究院(BAAI)によって開発された、1980億のパラメータを持つ中国の事前学習言語モデルであり、2021年にCPM-1の後継として公開され、大規模な生成および理解タスクに焦点を当てています。

CPM-2は、北京智源人工智能研究院(BAAI)によって開発された大規模な事前学習済み言語モデルである。2021年に公開され、CPM-1の後継モデルであり、1980億のパラメータを持つことで知られ、当時最大級の中国語モデルの一つであった。CPM-2は、テキスト生成、理解、対話など、幅広い自然言語処理タスクを処理するように設計されており、中国語に重点を置いている。

単一のアーキテクチャのみに依存する多くのモデルとは異なり、CPM-2はTransformer (architecture)フレームワーク内で混合専門家(MoE)アプローチを採用している。この設計により、モデルは各入力に対してパラメータの一部のみを活性化し、高いパフォーマンスを維持しながら計算効率を向上させることができる。モデルは、ウェブページ、書籍、その他のソースを含む多様な中国語テキストのコーパスでトレーニングされ、CLUE(中国語理解評価)などのベンチマークで強力な結果を示した。

アーキテクチャとトレーニング

CPM-2はTransformer (architecture)アーキテクチャに基づいて構築されており、特に生成タスク用のデコーダーのみの構造を使用している。その1980億のパラメータは複数の専門家層に編成されており、各トークンは少数の専門家にルーティングされ、推論あたりの実効計算コストを削減している。モデルは中国語のサブワード単位の語彙を使用し、Positional EncodingLayer Normalizationなどの技術を組み込んでトレーニングを安定させている。

トレーニングプロセスは2段階のアプローチを伴っていた。まず、大規模なコーパスでの高密度な事前学習フェーズ、続いてMoE構造を使用したスパースな微調整フェーズである。この方法により、BAAIは高密度アーキテクチャだけでは実現不可能な規模にモデルを拡張することができた。トレーニングデータは200ギガバイト以上の中国語テキストで構成され、モデルはGPUクラスターでトレーニングされたが、具体的なハードウェアの詳細は公開されていない。

機能と応用

CPM-2は、テキスト補完、要約、質問応答、対話生成など、さまざまなLarge language modelタスクに優れている。評価では、CLUEリーダーボードなどのいくつかの中国語ベンチマークで最先端の結果を達成し、特定の中国語タスクでGPT-3などの以前のモデルを上回った。モデルが長いコンテキストを処理し、一貫性のある文脈に関連したテキストを生成する能力は、コンテンツ作成、カスタマーサービス、教育ツールなどのアプリケーションに適していた。

注目すべき特徴の一つは、そのバイリンガル能力であり、CPM-2は英語のテキストも処理できるが、主な焦点は中国語である。この多様性は、トレーニングコーパスに英語データを含めることから生じており、言語間転移を可能にしている。モデルは2つのバージョンで利用可能である。フル198Bパラメータバージョンと、より小さな11Bパラメータバージョンであり、後者は研究や展開によりアクセスしやすい。

影響と評価

CPM-2はオープンソースモデルとして公開され、その重みとコードが研究コミュニティに提供された。このオープン性は、特に中国での学術的および産業的な設定での採用に貢献し、ドメイン固有のタスクでのさらなる微調整の基盤として機能した。モデルの公開はまた、大規模モデルのトレーニングの環境的および計算的コスト、ならびに効率的な推論方法の必要性についての議論を引き起こした。

OpenAIのGPT-3などの同時代のモデルと比較して、CPM-2は、特定の言語に焦点を当て、より効率的なMoEアーキテクチャを使用することで、競争力のあるパフォーマンスを達成できることを示した。その成功は、スパースモデルへのさらなる研究を促進し、CPM-3などのCPMシリーズの後続モデルの開発に貢献した。

制限と倫理的考慮事項

他の大規模言語モデルと同様に、CPM-2には制限があり、トレーニングデータの潜在的なバイアスが偏った出力につながる可能性がある。また、特にニッチなトピックでは、不正確または無意味な応答を生成する可能性がある。モデルの大規模さは展開に課題をもたらし、推論にかなりの計算リソースを必要とするため、リソースが制約された環境での使用が制限される。

BAAIはこれらの問題を認識しており、機密性の高いアプリケーションにモデルを展開する前に慎重な評価を推奨している。組織はまた、責任ある使用を強調し、研究者に生成されたコンテンツの倫理的影響を考慮するよう奨励している。2024年現在、CPM-2は中国語AIの発展における参照点であり続けているが、より高度な機能とさらに大きなパラメータ数を備えたより高度なモデルによって取って代わられている。

遺産と将来の方向性

CPM-2の公開は、Artificial intelligenceの分野、特に非英語言語モデルにとってのマイルストーンとなった。大規模な事前学習が英語以外の言語にも効果的に適用できることを実証し、他の言語での同様の取り組みへの道を開いた。CPM-2で使用されたMoEアーキテクチャは、Alibaba DAMO Academyや他の中国のAI研究機関からのモデルを含む、その後のモデル設計に影響を与えた。

CPMシリーズの将来の反復は、CPM-2の基盤の上に構築され、人間のフィードバックからの強化学習(Reinforcement Learning from AI Feedback (RLAIF))やより効率的なトレーニング方法などの新しい技術を組み込んでいる。CPM-2の遺産は、西洋のテックエコシステムの外でのスケーラブルでオープンソースのAI開発の実証にあり、より多様なグローバルAI環境に貢献している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·chinese-ai·transformer·open-source
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴