DeepSeek-V3の発表

英語からの翻訳

DeepSeek-V3は、671Bパラメータの混合専門家型大規模言語モデルであり、2024年12月に中国のAI企業DeepSeekによって公開された。OpenAIやGoogleのクローズドソースモデルに対抗するものである。

DeepSeek-V3は、中国浙江省杭州に拠点を置く中国の人工知能企業であるDeepSeekによって開発された大規模言語モデルである。2024年12月に公開されたこのモデルは、混合専門家(MoE)アーキテクチャを採用し、総パラメータ数は6710億、そのうちトークンごとに活性化されるのは370億である。このモデルは、OpenAIAnthropicGoogle DeepMindのプロプライエタリモデルと競合するよう設計されつつ、オープンウェイトモデルとして公開された。つまり、パラメータは公開されているが、トレーニングデータはオープンライセンスではない。

DeepSeek-V3の公開は、Generative AIの状況における重要な節目となり、高性能モデルが古いハードウェア上でも効率的にトレーニングできることを実証した。これは、米国による中国への高度なチップ輸出制限に一部起因している。モデルの公開には技術レポートとオープンウェイトが伴い、研究者や開発者がモデルを使用・微調整できるようになり、さまざまなアプリケーションでの急速な採用に貢献した。

背景

DeepSeekは、2023年7月に梁文鋒によって設立された。彼はまた、当初AI駆動型トレーディングに焦点を当てていた中国のヘッジファンドであるHigh-Flyerの共同設立者でもある。同社の起源は、2019年に1,100基のGPUを200 Gbit/sで相互接続したFire-Flyerを含む、High-FlyerのGPUベースのコンピューティングクラスタへの投資に遡る。2021年までに、High-Flyerは米国の輸出制限が発効する前にNvidia A100 GPUを10,000基取得し、625ノードに5,000基のPCIe A100 GPUを搭載したより大規模なクラスタであるFire-Flyer 2の構築を可能にした。

DeepSeekの使命は、オープンウェイトモデルに焦点を当てた汎用人工知能研究を前進させることである。同社は中国のトップ大学から研究者を採用し、詩や高等数学などの非伝統的な分野からも人材を採用して、モデルの能力を広げている。このアプローチと研究第一の戦略により、DeepSeekはモデルアーキテクチャとトレーニング効率において革新を起こすことができた。

モデルアーキテクチャ

DeepSeek-V3は混合専門家アーキテクチャを採用している。これは、モデルを複数の専門化されたサブネットワーク(専門家)に分割し、各入力に対してサブセットのみを活性化する設計である。このアプローチは、高い容量を維持しながら計算コストを削減する。モデルは6710億のパラメータを持つが、トークンごとに活性化されるのは370億のみであり、効率的な推論とトレーニングを可能にする。

このアーキテクチャは、マルチヘッド潜在注意や補助損失なしの負荷分散などの革新を取り入れており、トレーニングの安定性とパフォーマンスを向上させる。これらの技術は、Transformer (architecture)モデルやMulti-Head Attentionにおける初期の研究に基づいており、DeepSeek-V3が長いコンテキストと複雑な推論タスクを効果的に処理することを可能にしている。

トレーニングとインフラストラクチャ

DeepSeek-V3は、カスタムソフトウェアとハードウェアで共同設計されたコンピューティングクラスタであるFire-Flyer 2でトレーニングされた。このクラスタは、200 Gbpsの相互接続と高バイセクション帯域幅のためのファットツリーネットワークトポロジを備えたNvidia GPUを使用している。ソフトウェアスタックには、非同期ランダム読み取り用に最適化された分散並列ファイルシステムである3FSと、非同期通信用ライブラリであるhfreduceが含まれる。

この規模のモデルのトレーニングには、かなりの計算リソースが必要であった。DeepSeekは、Fire-Flyer 2が2022年に96%以上の容量で使用され、合計5,674万GPU時間に達したと報告した。クラスタの設計は効率性を重視しており、モデルが40 GB VRAMに収まるため当初はPCIe A100 GPUを使用し、その後、モデル並列性を必要とする大規模モデルにはNVLinkとNCCLを組み込んだ。

トレーニングプロセスでは、安定性を確保するためにAdam (Optimizer)の変種、Learning Rate SchedulingGradient Clippingなどの技術が使用された可能性が高い。DeepSeekのアルゴリズム効率への焦点により、ハードウェアの制約にもかかわらず競争力のあるモデルをトレーニングできた。これは、米国のチップ制限への対応として指摘されている戦略である。

パフォーマンスとベンチマーク

DeepSeek-V3は、さまざまなベンチマークで競争力のあるパフォーマンスを実証し、OpenAIGoogle DeepMindのクローズドソースモデルに対抗した。内部評価では、自然言語理解、コード生成、数学的推論において強い結果を達成した。例えば、特定のコーディングタスクではGPT-4oなどのモデルを上回ったと報告されているが、公開時点での独立した検証は限られていた。

モデルのオープンウェイトな性質により、研究コミュニティはその能力をテスト・検証でき、学術および商業の両方の環境で広く採用されることにつながった。その効率性とパフォーマンスは、計算リソースが限られている組織にとって特に魅力的であった。

公開と評価

2024年12月のDeepSeek-V3の公開は、AIコミュニティで大きな注目を集めた。これは、オープンウェイトモデルがプロプライエタリシステムに挑戦できる証拠と見なされ、AI開発の未来に関する議論を巻き起こした。このモデルは、Microsoft AzureやPerplexity AIなどのクラウドプロバイダーによってホストされ、幅広いユーザーが利用できるようになった。

批評家は、DeepSeekのオープンウェイトアプローチはパラメータに関しては透明であるものの、トレーニングデータを開示しておらず、データの出所や潜在的なバイアスに関する疑問を提起していると指摘した。さらに、同社とHigh-Flyerとの関係や、研究者の中国防衛機関との関係は精査の対象となったが、DeepSeekは研究に焦点を当てていると述べている。

影響と遺産

DeepSeek-V3は、2025年1月に推論機能を組み込んだDeepSeek-R1の公開など、AI分野のその後の発展に影響を与えた。このモデルはまた、効率的なAIという広範なトレンドに貢献し、他の企業がより低いリソース消費に最適化することを促した。

この公開は地政学的な影響もあり、輸出管理にもかかわらず中国企業が革新できることを浮き彫りにした。また、オープンウェイトモデルが高度な技術への幅広いアクセスを可能にするため、AIの民主化に関する議論も促進した。

今後の方向性

DeepSeek-V3に続き、DeepSeekはオープンソースライセンスの下でモデルを公開し続け、そのポートフォリオを拡大している。研究と効率性に焦点を当てた同社の戦略は、世界のAI情勢における主要プレーヤーとしての地位を確立している。2025年現在、Fire-Flyer 2は運用を継続しており、進行中の研究開発を支援している。

DeepSeekのアフリカへの拡大は、手頃でエネルギー効率の高いAIソリューションを提供するものであり、十分にサービスが行き届いていない市場に到達するという同社の野心を示している。同社の今後のリリースは、DeepSeek-V3で導入された革新に基づいて構築される可能性が高く、次世代のLarge language modelに影響を与える可能性がある。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deepseek-v3·large-language-model·ai-launch·open-weights
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴