DeepSeek V3は、中国のAI企業DeepSeekによって開発された大規模言語モデルであり、2024年12月26日に初めて公開された。これはトランスフォーマーベースのアーキテクチャを採用し、Mixture-of-Experts(MoE)設計を用いており、総パラメータ数は6710億で、そのうち370億がトークンごとに活性化される。このモデルは14.8兆トークンで訓練され、その費用効率の高い訓練プロセスで注目されており、わずか278万8000時間のH800 GPU使用時間で済んだと報告されている。
DeepSeek V3は公開直後に、公開LLMおよびメディアのリーダーボードに登場し、ベンチマークのスナップショットでは複数のバリアントにわたって一貫した性能を示した。このモデルファミリーには、これらのスナップショットにおいて少なくとも5つのバリアントが含まれており、異なる構成やファインチューニング状態を反映しているが、各バリアントの具体的な詳細は公に文書化されていない。ベースモデルとその指示チューニング版は、標準的な学術ベンチマークで評価されている。
アーキテクチャと訓練
DeepSeek V3は、61層のトランスフォーマーブロックからなる深層学習アーキテクチャを使用している。効率的な推論のためにマルチヘッド潜在注意(MLA)を組み込み、フィードフォワード層にはDeepSeekMoE構造を採用しており、各トークンは専門家のサブセットのみを活性化する。このモデルは12万8000トークンの語彙を使用し、12万8000トークンのコンテキスト長をサポートする。
訓練は、ピーク学習率2.4e-3の学習率スケジュールを用いて実施され、大規模訓練向けに適応された勾配クリッピングおよびバッチ正規化技術と組み合わせられた。データセットは14.8兆トークンで構成され、主に英語と中国語であり、ウェブテキスト、書籍、その他の厳選されたコーパスから収集された。訓練プロセスでは、TSMC製造のH800 GPUが使用され、最終的な訓練実行のコストは約560万ドルと報告されている。
性能とベンチマーク
公開ベンチマークでは、DeepSeek V3は注目すべきスコアを達成した。MMLU(Massive Multitask Language Understanding)ベンチマークでは、5ショット設定で88.5%を記録した。MATH-500ベンチマークでは、ゼロショット設定で90.2%を達成した。このモデルはコーディングタスクでも優れた性能を示し、HumanEvalで82.6%、より困難なLiveCodeBenchで67.3%を記録した。
同時代のモデルと比較して、DeepSeek V3の性能はOpenAIやAnthropicの主要なプロプライエタリシステムと競争力があり、訓練コストは大幅に低かった。GPQA(Graduate-Level Google-Proof Q&A)ベンチマークでは、ゼロショット設定で59.1%を記録し、DROPベンチマークでは、3ショット設定で91.6%を達成した。
リリースとバリアント
2024年12月26日の初回リリースには、ベースモデルとチャット最適化版のDeepSeek-V3-Chatが含まれていた。両方ともMITライセンスの下で利用可能となり、商用利用と改変が許可された。モデルの重みはHugging Faceや他のプラットフォームを通じて配布され、生成AIコミュニティでの広範な採用を可能にした。
2025年初頭の公開ベンチマークスナップショットでは、DeepSeek V3の少なくとも5つの異なるバリアントが示されており、これらは異なるファインチューニング実行や量子化レベルを表している可能性が高い。これらのバリアントは、LMSYS Chatbot ArenaやOpen LLM Leaderboardなどのリーダーボードに登場しているが、各バリアントの正確な構成は公式には文書化されていない。2025年初頭の時点で、ベース版とチャット版以外の追加の公式バリアントは発表されていない。
影響と評価
DeepSeek V3のリリースは、高い性能と低い訓練コストの組み合わせにより、人工知能コミュニティで大きな注目を集めた。これは、効率的な訓練技術が、大幅に大きな予算で開発されたモデルの能力に対抗できることを実証した。MITライセンスの下でのモデルのオープンソース性は、さまざまなアプリケーションや研究プロジェクトへの迅速な統合に貢献した。
批評家やアナリストは、DeepSeek V3の訓練効率が、推論中の計算コストを削減するMoEアーキテクチャに一部起因していると指摘した。しかし、このモデルの総パラメータ数の多さへの依存は、展開にかなりのメモリを依然として必要とする。このモデルはまた、機械学習の競争環境、特に中国のAI企業がオープンソースモデルの進歩において果たす役割についての議論を引き起こした。
技術的詳細と制限
DeepSeek V3は、カスタムの位置エンコーディング方式を採用し、マルチヘッド注意メカニズムを使用している。注意層では従来のドロップアウトを使用せず、これは訓練効率を向上させる設計上の選択である。モデルの推論は、制御された生成のためにトップpサンプリングおよび温度スケーリングをサポートする。
その強みにもかかわらず、DeepSeek V3には制限がある。訓練データに存在するバイアスを示す可能性があり、中国語以外の非英語言語での性能は十分に評価されていない。モデルの大きなメモリフットプリントは、コンシューマーハードウェアでの展開を制限し、一部の設定での実用的な使用にはモデルプルーニングまたは量子化が必要となる。2025年初頭の時点で、このモデルは後継機で更新されていないが、DeepSeekでの継続的な研究は続いている。