Huawei PanGuは、中国のテクノロジー企業であるHuawei(リンクはリストにありません)によって開発された大規模言語モデルのファミリーです。このシリーズは2021年4月にPanGu-αのリリースとともに導入され、2000億パラメータを持つモデルであり、当時最大級の言語モデルの一つとなりました。PanGuモデルはTransformer (architecture)アーキテクチャを使用して構築され、中国語と英語の大規模なテキストコーパスでトレーニングされています。これらはHuawei Cloudを通じてAIサービスとして展開され、自然言語理解、生成、対話、コード補完などのアプリケーションに利用されています。
アーキテクチャとトレーニング
PanGuシリーズには、PanGu-α、PanGu-Coder、PanGu-Σなどの複数のモデルバリアントが含まれます。元のモデルであるPanGu-αは、高密度トランスフォーマーアーキテクチャを使用し、2.6テラバイトのコーパスでトレーニングされました。2022年にリリースされたPanGu-Coderは、コード生成に特化したモデルであり、オープンソースのコードリポジトリでトレーニングされています。2023年に導入されたPanGu-Σは、数千億のパラメータを持つスパーストランスフォーマーモデルであり、計算コストを削減するための階層アーキテクチャに基づいています。トレーニングはHuaweiのAscend 910 AIチップで実行され、安定性のために残差接続とレイヤー正規化を活用しています。
機能とアプリケーション
PanGuモデルは、テキスト要約、機械翻訳、質問応答、対話生成などのタスクをサポートしています。2021年の評価では、PanGu-αは複数の中国語自然言語理解タスクでベンチマークされ、いくつかのデータセットにおいてゼロショットおよび少数ショット設定でOpenAIのGPT-3を上回ったと報告されています。HuaweiはPanGuモデルをクラウドサービスに統合しており、企業がカスタムAIアプリケーションを構築するためのローコードおよびノーコードツールを提供するPangu PanguStudioプラットフォームを含みます。これらのモデルは金融、医療、製造などの業界で使用されており、TomTom、Intuitive Surgical、Commureなどのパートナー企業でのドメイン固有タスクへの展開が報告されていますが、詳細は広く公開されていません。
アーキテクチャの改善
効率を向上させるために、PanGu-Σは「ウェイトリフティング」と呼ばれる方法や「並列アテンション」メカニズムなどの革新を取り入れています。トレーニングプロセスでは、パラメータの肥大化を減らすためにプルーニングとデータ拡張技術を使用しています。後のバージョンでは、出力をユーザーの好みに合わせるためにRLAIF(AIフィードバックからの強化学習)が採用されています。モデルはまた、層全体でマルチヘッドアテンションとクロスアテンションブロックを使用しています。
リリース履歴とエコシステム
PanGu-αは2021年に初めてリリースされました。2022年には、HuaweiはPanGu-Coderとビジョン用のPanGu-CVをリリースしました。2023年には、PanGu-Σが7000億パラメータと主張されてリリースされました。2024年には、Huaweiはクラウド上でPanGu StudioとPanGu Foundation Modelサービスを開始し、HarmonyOSオペレーティングシステムへの統合も行いました。これらのモデルはHuaweiのクラウドプラットフォームの対応物を通じてアクセス可能ですが、Huawei Cloudを通じて直接提供もされています。Alibaba Cloudや他のプロバイダーとのパートナーシップは公開されていません。
評価と論争
2021年には、初期の批判者からデータセットの規模と潜在的なトレーニングデータ漏洩について懸念が提起されました。Huaweiは、PanGu-αが一部の中国語ベンチマークでGPT-3を上回ったと主張するベンチマーク結果を公開しましたが、独立した検証は限られていました。モデルのリリースは、言語モデルのベンチマークと結果の再現性に関する議論を引き起こし、DeepMindや他の研究所をめぐる同様の議論を反映しています。PanGuはまた、中国の国内AI能力の推進と外国の著者への依存低減の一環でもあります。2024年現在、モデルは引き続きアクティブであり、HuaweiはGPT-4やAnthropic(リンクはありません)などの他のLLMと競争するために継続的な開発に投資しています。