DeepSeek-V2の発表

英語からの翻訳

2024年5月にリリースされたDeepSeek-V2は、中国のAI企業DeepSeekによって開発されたMixture-of-Experts大規模言語モデルであり、低いトレーニングコストと同等モデルと比較した高い性能で注目されています。

DeepSeek-V2は、2024年5月に中国の人工知能企業DeepSeekが公開した大規模言語モデルである。Mixture-of-Experts(MoE)アーキテクチャを採用しており、各入力に対してパラメータの一部のみを活性化することで、効率的な計算とトレーニングコストの削減を実現している。このモデルは、西側の開発者による当時のモデルに対する高性能な代替手段として位置づけられ、報告されたトレーニングコストは同等のシステムと比較して大幅に低いものであった。

DeepSeek-V2の公開は、大規模言語モデルが急速に進歩していた時期に行われ、OpenAIAnthropicGoogle DeepMindなどの開発者も新しいシステムを発表していた。DeepSeekのアプローチは、オープンウェイトとコスト効率を重視する点で異なっており、ハードウェア制約下でのアルゴリズム効率の最大化という同社の広範な戦略に沿ったものであった。

アーキテクチャと設計

DeepSeek-V2は、現代の生成AIシステムの主要なフレームワークであるTransformerアーキテクチャに基づいている。その特徴的な要素はMixture-of-Experts設計であり、モデルのパラメータを複数のエキスパートモジュールに分割する。推論中、ゲーティングメカニズムが各トークンに対して少数のエキスパートのみを選択し、総パラメータ数を維持しながら計算負荷を削減する。

このモデルは、マルチヘッドアテンション位置エンコーディングにおける革新を取り入れ、効率を向上させている。具体的には、DeepSeek-V2は、長文コンテキストタスクにおける一般的なボトルネックであるキー・バリューキャッシュのメモリフットプリントを削減する新しいアテンションメカニズムを導入した。この設計により、ハードウェア要件を比例的に増やすことなく、より長いシーケンスを処理できる。

同様のパラメータサイズの高密度モデルと比較して、DeepSeek-V2はトレーニングと推論の両方でトークンあたりの浮動小数点演算が少なくて済む。同社は、このモデルが主要なシステムと競合する性能を達成しつつ、計算量を大幅に削減したと報告しており、これはMoEアーキテクチャとトレーニングパイプラインの慎重なエンジニアリングによるものとされている。

トレーニングとコスト

DeepSeek-V2は、DeepSeekの親会社であるHigh-Flyerが運営するカスタム構築システムであるFire-Flyer 2コンピューティングクラスタでトレーニングされた。このクラスタは、高帯域幅で相互接続された数千のNvidia GPUで構成され、3FS分散ファイルシステムやカスタム通信ライブラリを含む共同設計のソフトウェアスタックを備えている。このインフラストラクチャは、特に米国による中国への高度なチップ輸出制限を考慮し、利用可能なハードウェアでの効率を最大化するために開発された。

DeepSeek-V2のトレーニング実行には、公開ウェブソース、書籍、その他のテキストコーパスから抽出された数兆トークンのデータセットが使用された。同社は、モデルウェイトを公開しながらもトレーニングデータを独自に保持する方針に沿って、正確なデータセット構成を開示しなかった。報告されたトレーニングコストは約560万ドルであり、西側の研究所による同等モデルの推定値よりも一桁低い数字として注目を集めた。

このコスト効率は、アルゴリズムの改善、ハードウェアの最適化、およびMoEアーキテクチャによる計算要件の削減の組み合わせによって達成された。DeepSeekのエンジニアはまた、勾配クリッピング学習率スケジューリングなどの技術を採用し、トレーニングを安定させ、収束を改善した。

性能とベンチマーク

DeepSeek-V2は、言語理解、推論、コード生成などの自然言語処理タスクの標準ベンチマークで評価された。MMLU(Massive Multitask Language Understanding)やHumanEvalなどの広く使用されるいくつかのテストでは、このモデルは他の開発者による当時のオープンウェイトモデルと同等またはそれを上回るスコアを達成した。

このモデルの性能は、特に数学的推論と中国語タスクで顕著であり、トレーニングデータの構成と、国内および国際ユーザーの両方にサービスを提供するという同社の焦点を反映している。直接比較では、DeepSeek-V2はいくつかのより大きな高密度モデルを上回り、MoEアプローチが少ないアクティブパラメータで強力な結果を提供できることを実証した。

第三者研究者による独立した評価は、一般的に同社の主張を確認したが、一部では特定のベンチマークでの性能が評価設定によって異なることが指摘された。公開にはモデルの小型バリアントも含まれており、フルモデルの能力の多くを維持しながら、より低性能のハードウェアでの展開が可能となった。

公開と受け止め方

2024年5月のDeepSeek-V2の公開には、モデルウェイトと、そのアーキテクチャとトレーニング方法論を説明する技術文書の両方が含まれていた。このオープンウェイトアプローチは、APIのみのアクセスで提供される独自モデルとは異なり、研究者や開発者がモデルをダウンロードし、微調整し、自社のインフラストラクチャに展開することを可能にした。

機械学習コミュニティでの受け止め方は概ね好意的であり、多くの人が技術的革新と公開の透明性を賞賛した。低いトレーニングコストは議論の焦点となり、他の開発者も同様の効率向上を達成できるかどうかという疑問を提起した。一部のコメンテーターは、この公開を、高度なAI開発がもはや資金力のある西側企業の独占領域ではないことの証拠と解釈した。

しかし、この公開は、オープンウェイトと、一部の商用製品と比較して組み込みの安全フィルタがないことから、悪用の可能性に関する懸念も引き起こした。DeepSeekの中国との関係や、一部の研究者の過去の軍事的関与が報道で指摘されたが、同社自身は研究への焦点を強調し、軍事的応用を否定した。

当時のモデルとの比較

公開当時、DeepSeek-V2は、MetaのLlama 3やMistralのMixtralなど、オープンウェイトまたはオープンソースアプローチを採用したモデルと頻繁に比較された。生のベンチマークスコアでは、DeepSeek-V2はこれらのシステムと競合し、トレーニングコストは同等モデルの公表値よりも大幅に低かった。

このモデルはまた、OpenAIAnthropicの独自システムとの比較も引き寄せたが、直接比較は評価方法の違いやそれらのシステムの閉鎖性により複雑であった。DeepSeekが詳細な技術レポートを公開したことで、APIのみのモデルよりも徹底的な分析が可能となった。

注目すべき違いの1つは、DeepSeek-V2の中国語タスクでの性能であり、英語データを主にトレーニングしたモデルをしばしば上回った。これにより、金融、教育、政府などのエンタープライズ用途を含む中国語圏市場でのアプリケーションに特に魅力的なものとなった。

影響と遺産

DeepSeek-V2は、同社をグローバルなAI環境における重要なプレーヤーとして確立し、効率的なトレーニング技術が最先端の結果をもたらすことを実証した。このモデルの成功は、Mixture-of-Expertsアーキテクチャへの関心の高まりやコスト意識の高いトレーニング方法など、その後の分野の発展に影響を与えた。

この公開はまた、地政学的な影響もあり、輸出規制にもかかわらず中国企業が高度なAIシステムを開発できることを浮き彫りにした。必要性から生まれたDeepSeekのアルゴリズム効率への焦点は、同様の制約に直面する他の開発者にとってのモデルとなった。

公開後の数ヶ月で、DeepSeekは技術の反復を続け、さらなる改善を備えた後継モデルを最終的に公開した。DeepSeek-V2で確立された原則、すなわちオープンウェイト、コスト効率、アーキテクチャの革新は、その後の公開でも同社のアプローチの中心であり続けた。

技術仕様

DeepSeek-V2の総パラメータ数は2360億と報告され、MoEアーキテクチャによりトークンあたりのアクティブパラメータはわずか210億である。このモデルは、メモリ使用量を削減する効率的なアテンションメカニズムにより、128,000トークンのコンテキストウィンドウを使用した。トレーニングは混合精度で行われ、BF16とFP32形式を組み合わせて精度と速度のバランスを取った。

モデルのトークナイザーは多言語コーパスでトレーニングされ、特に中国語と英語のテキストに注意が払われた。公開には、vLLMやTensorRTなどの一般的な推論フレームワークと互換性のある複数形式のウェイトが含まれていた。総パラメータ数が少ない小型バージョンのモデルも、低性能ハードウェアでの展開用に提供された。

DeepSeek-V2のアーキテクチャは、同社のラインナップにおけるその後のモデルの基盤として機能し、後の公開ではその革新を基盤に、人間のフィードバックからの強化学習などの追加技術を組み込んだ。このモデルは現在もダウンロード可能であり、その技術文書は効率的な言語モデルトレーニングに関する学術研究で引き続き引用されている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·large-language-models·deepseek·machine-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴