Google PaLM 2は、Google AIによって開発された大規模言語モデル(LLM)であり、2023年5月の年次Google I/O基調講演で発表された。これは、2022年4月に初めて導入された5400億パラメータの高密度デコーダー専用トランスフォーマーベースのモデルであるPathways Language Model(PaLM)の後継である。PaLM 2は、3400億パラメータのモデルであり、3.6兆トークンで訓練されたと報告されており、これは前身の7800億トークンから大幅に増加している。このモデルは、Googleの会話型AIサービスであるBardやその他のGoogle AI製品を支え、多言語機能の強化、推論の改善、コーディング能力の向上を実現している。
PaLM 2は、高密度デコーダー専用トランスフォーマーとして設計されたPaLMのアーキテクチャ基盤を基に構築されている。元のPaLMモデルは、常識推論、算術推論、ジョーク説明、コード生成、翻訳などのタスクで強力なパフォーマンスを示した。チェーン・オブ・ソート・プロンプティングと組み合わせると、PaLMは多段階の推論を必要とするデータセット(文章問題や論理ベースの質問を含む)で大幅に優れた結果を達成した。PaLM 2はこれらの能力を拡張し、特に多言語コンテキストにおいて、より広範な言語をより高い精度で理解・生成できるようにしている。
開発と発表
元のPaLMモデルは2022年4月に初めて発表されたが、2023年3月にGoogleがPaLMおよび他のいくつかの技術のAPIを開始するまで非公開のままであった。このAPIは当初、公開される前にウェイトリストに参加した限られた開発者に利用可能だった。PaLM 2は2023年5月のGoogle I/Oで公開され、GoogleのGenerative AIへの取り組みにおける重要なマイルストーンとなった。この発表では、PaLM 2の前身に対する効率性とパフォーマンスの向上が強調され、Googleの製品エコシステムにおける実用的なアプリケーションに焦点が当てられた。
GoogleとDeepMindはまた、PaLMの専門バージョンも開発した。Med-PaLMは、医療データで微調整されたPaLM 540Bのバージョンであり、医療質問応答ベンチマークで以前のモデルを上回るパフォーマンスを示した。これは、米国の医療免許試験で合格点を取得した最初のモデルであり、正確な回答とともに推論と自己評価を提供した。別の変種であるPaLM-Eは、視覚トランスフォーマーを使用してPaLMを拡張し、再訓練や微調整なしでロボット操作のための視覚言語モデルを作成した。2023年6月、GoogleはPaLM-2アーキテクチャと初期化を使用する音声間翻訳用のAudioPaLMを発表した。
アーキテクチャと訓練
PaLM 2は、前身と同様の高密度デコーダー専用Transformer (architecture)モデルであるが、より大規模な訓練コーパスを持つ。元のPaLMは、フィルタリングされたウェブページ、書籍、Wikipedia記事、ニュース記事、GitHubのオープンソースリポジトリからのソースコード、ソーシャルメディアの会話を含む7800億トークンの高品質コーパスで事前訓練された。ソーシャルメディアの会話部分はコーパスの50%を占め、会話能力を向上させた。PaLM 2の訓練データは3.6兆トークンに拡大され、より良い一般化と多言語パフォーマンスを可能にした。
元のPaLM 540Bは、それぞれ768ホストに接続された3,072個のTPU v4チップを持つ2つのTPU v4 Podで、モデル並列性とデータ並列性の組み合わせを使用して訓練された。この構成は合計6,144チップであり、その規模でのLLMの最高訓練効率の記録を示し、ハードウェアFLOPs利用率は57.8%だった。PaLM 2の訓練詳細は公に文書化されていないが、GoogleのGoogle Cloudと専用ハードウェアへの投資を反映して、同様のインフラストラクチャを使用した可能性が高い。
能力と応用
PaLM 2は、多言語タスク、推論、コーディングに優れるように設計されている。これはGoogleの会話型AIであるBardを支え、Google WorkspaceやGoogle CloudのAIサービスなどの他の製品にも統合されている。このモデルの改善された多言語能力により、以前のモデルよりも効果的に言語間での翻訳、要約、質問応答を処理できる。その推論能力は、チェーン・オブ・ソート・プロンプティングなどの技術を通じて強化され、多段階の問題解決を可能にしている。
コーディングにおいて、PaLM 2は複数のプログラミング言語にわたるコード生成とデバッグをサポートし、開発者にとってのツールとなっている。このモデルの汎用性は、Machine learning研究からエンタープライズソリューションまで、さまざまなアプリケーションで実証されている。GoogleはPaLM 2をAIエコシステムの基盤モデルとして位置づけ、OpenAIやAnthropicの提供と競合している。
他のモデルとの比較
PaLM 2の3400億パラメータは、Large language modelの上位層に位置するが、OpenAIのGPT-4などの一部の競合他社(混合専門家アーキテクチャで1兆以上のパラメータを持つと報告されている)よりは小さい。しかし、PaLM 2の3.6兆トークンでの訓練と効率性への焦点により、ベンチマークで競争力のあるパフォーマンスを達成できる。このモデルのアーキテクチャは、Transformer (architecture)フレームワークに基づいており、他のLLMと類似しているが、Googleの独自の訓練技術とインフラストラクチャは、スケーラビリティにおいて明確な利点を与えている。
前身のPaLMと比較して、PaLM 2は多言語理解と推論の大幅な改善、および推論の計算要件の削減を提供する。これにより、実世界のアプリケーションでの展開がよりアクセスしやすくなっている。GoogleのBardやGoogle CloudのVertex AIなどの製品へのPaLM 2の統合は、そのリーチを広げ、Artificial intelligenceの状況における主要プレーヤーとして位置づけている。
影響と評価
2023年5月のPaLM 2の発表は、AIコミュニティや業界関係者から注目を集めた。これは、特に生成AIの競争の激しい分野において、GoogleがDeep learningとNeural network技術を進歩させるというコミットメントを示した。このモデルの改善された多言語能力は、AIを非英語話者にアクセスしやすくする一歩と見なされ、そのコーディング能力は開発者にアピールした。
しかし、PaLM 2はまた、大規模モデルの訓練の環境影響に関する疑問を提起したが、Googleは効率性の改善を強調している。このモデルのBardへの統合は、バイアスや誤情報の問題を含むAIの倫理に関する議論を引き起こし、これらはGenerative AIシステムに共通する懸念事項である。Googleは安全対策を実施しているが、より広範な影響は依然として議論の対象となっている。
将来の方向性
PaLM 2に続いて、GoogleはAIモデルの進化を続けた。2023年後半、GoogleはPaLM 2の後継であるGeminiを発表し、これはマルチモーダル機能を統合し、より強力で汎用性が高いように設計されている。PaLM 2のアーキテクチャと訓練方法は、Multi-Head AttentionやPositional Encoding技術の改善を含むその後の開発に影響を与えた。このモデルの遺産は、ヘルスケアからロボティクスまでの分野での応用を含む、Artificial intelligenceの限界を押し広げるGoogleの継続的な取り組みに明らかである。
2025年現在、PaLM 2はLLMの歴史における重要なマイルストーンであり、LaMDAなどの初期モデルとGeminiなどのより高度なシステムとの間の橋渡しを表している。多言語AIと効率的な訓練へのその貢献は、この分野に永続的な影響を与えており、その原則はGoogle DeepMindやそれ以降の研究に情報を提供し続けている。
関連項目
- LaMDA、PaLMの前身
- Gemini、PaLMの後継
- Chinchilla、関連するLLM
- Transformer (architecture)、基盤となるアーキテクチャ
- Google Cloud、訓練のためのインフラストラクチャ
参考文献
- Google AIブログ、2023年5月、PaLM 2発表
- Wikipedia、PaLM(Pathways Language Model)、2025年アクセス
- Google Research、PaLM: Scaling Language Modeling with Pathways、2022年