DeepSeek V3.1は、中国のAI企業DeepSeekによって開発された大規模言語モデルのファミリーである。2025年にリリースされ、2024年末に導入されたDeepSeek V3の後継モデルである。V3.1ファミリーには、公開されているLLMおよびメディアのリーダーボードに登場した4つのバリアントが含まれるが、同社はそのすべてについて詳細な技術仕様を公開していない。これらのモデルは、汎用のテキスト生成、推論、コーディングタスク向けに設計されており、オープンソースライセンスの下で利用可能である。
DeepSeek V3.1の開発は、Transformer (architecture)アーキテクチャに基づいており、特にMixture-of-Experts(MoE)設計を採用して、トークンごとにパラメータのサブセットのみを活性化し、計算効率を向上させている。このモデルファミリーは、生成AIにおけるますます大規模で高性能なシステムへの広範なトレンドの一部であり、OpenAI、Anthropic、Google DeepMindの製品と競合している。DeepSeekはV3.1をコスト効率の高い代替手段として位置づけており、トレーニングおよび推論コストは多くの西側の競合製品よりも大幅に低い。
アーキテクチャとトレーニング
DeepSeek V3.1は、Mixture-of-Expertsアーキテクチャを備えたニューラルネットワークを採用しており、各トークンは少数のエキスパートモジュールによって処理される。この設計により、トークンあたりの計算コストが削減されつつ、高いモデル容量が維持される。ベースモデルであるDeepSeek V3は、総パラメータ数6710億、トークンあたり活性化パラメータ数370億であった。V3.1も同様の構造に従う可能性が高いが、新しいバリアントの正確なパラメータ数は公式には開示されていない。モデルは、深層学習技術を使用してトレーニングされ、教師ありファインチューニングや人間のフィードバックからの強化学習(RLHF)を含み、出力を人間の好みに合わせて調整している。
V3.1のトレーニングデータには、英語と中国語に焦点を当てた大規模な多言語テキストコーパスが含まれる。同社はデータセットのサイズや構成に関する具体的な詳細を公開していないが、DeepSeekが公開されているウェブデータと独自のソースの組み合わせを使用していることが知られている。トレーニングプロセスはGPUクラスターを活用しており、DeepSeekはFP8混合精度トレーニングの使用など、トレーニング効率の最適化に関する研究を公開している。
バリアントとベンチマーク
DeepSeek V3.1の4つのバリアントが公開ベンチマークのスナップショットで確認されており、パラメータ数やファインチューニングが異なる可能性がある。これらのバリアントは、MMLU(知識)、HumanEval(コード生成)、MATH(数学的推論)などの標準的なLLMベンチマークで評価されている。例えば、あるバリアントはMMLUで88.5%のスコアを達成し、同じテストでの元のV3の86.2%を上回っている。HumanEvalでは、あるバリアントが82.3%をスコアし、V3の78.1%と比較される。これらのスコアにより、V3.1はトップクラスのオープンウェイトモデルの中に位置づけられるが、具体的な数値はバリアントや評価設定によって異なる。
LMArena(Chatbot Arena)のEloレーティングなどのメディアのリーダーボードでは、DeepSeek V3.1のバリアントは1300〜1400の範囲のEloスコアを達成しており、GPT-4oやClaude 3.5 Sonnetなどのプロプライエタリモデルに匹敵する。ただし、正確なEloレーティングは、より多くのユーザーボートが収集されるにつれて変更される可能性がある。モデルはコーディングタスクでも強いパフォーマンスを示しており、あるバリアントは実世界のソフトウェアエンジニアリング問題をテストするSWE-benchベンチマークで75.4%のpass@1スコアを達成している。
リリースと利用可能性
DeepSeek V3.1は2025年初頭にリリースされ、最初のバリアントが同社のAPIおよびオープンソースのダウンロードとして登場した。モデルはMITライセンスの下で配布され、商用および研究利用が可能である。DeepSeekはモデルの重みをHugging Faceで利用可能にしており、推論用のコードはGitHubで提供されている。同社はまた、OpenAIやAnthropicの同等モデルよりも大幅に低い価格のAPIを提供している。例えば、リリース日時点で、入力トークンは100万トークンあたり0.27ドル、出力トークンは100万トークンあたり1.10ドルと価格設定されている。
リリースには、トレーニング方法論と評価結果を詳述した技術レポートが伴っていたが、正確なトレーニングトークン数などの一部の詳細は省略されている。DeepSeekはまた、モデルアーキテクチャにおけるマルチヘッドアテンションと位置エンコーディングの使用に関する論文を公開しており、機械学習の広範な学術文献に貢献している。
評価と影響
DeepSeek V3.1のリリースは、プロプライエタリモデルのコストの一部で競争力のあるパフォーマンスを発揮したため、AIコミュニティで大きな注目を集めた。ソーシャルメディアやテックプレスで広く議論され、一部のコメンテーターは、中国のAI企業の急速な進歩を示していると指摘した。モデルのオープンソース性は、研究や産業での採用を促進し、さまざまなサードパーティのツールやプラットフォームに統合されている。
しかし、一部の専門家は、トレーニングデータに関する透明性の欠如や潜在的なバイアスについて懸念を表明している。DeepSeekは詳細なモデルカードを公開しておらず、独立した監査も実施されていない。2025年時点で、モデルはまだ活発に開発中であり、将来のアップデートが期待されている。
前モデルとの比較
DeepSeek V3.1は、推論、コーディング、多言語理解など、いくつかの主要な領域でV3を改善している。同社は、V3.1が12の標準ベンチマークでV3と比較して平均2.3%の改善を達成したと報告している。例えば、MMLUベンチマークでは、V3.1は88.5%をスコアし、V3の86.2%と比較され、HumanEvalベンチマークでは82.3%をスコアし、78.1%と比較される。改善は、より良いトレーニングデータ、より洗練されたファインチューニング、およびアーキテクチャの調整に起因している。
単一モデルであったV3とは異なり、V3.1はバリアントのファミリーであり、ユーザーはパフォーマンスとリソース使用量のバランスを取るモデルを選択できる。このアプローチは、OpenAIのGPT-4oやGPT-4o miniなどの他のプロバイダーのアプローチに似ているが、DeepSeekのバリアントはすべてオープンウェイトである。V3.1のリリースには、更新されたトークナイザーとコンテキスト長も含まれており、最大128Kトークンをサポートし、主要モデルの機能に匹敵する。
将来の方向性
DeepSeekはモデルファミリーの反復を続けており、V3.1の後にさらなるアップデートが続くことが期待されている。同社は、テキストに加えて画像や音声を処理できるようにするマルチモーダル機能に関する作業を示唆している。2025年時点で、V4の公式なリリース日は発表されていないが、急速な開発ペースは、新しいバージョンが年内に登場することを示唆している。DeepSeekのモデルが広範なAI環境に与える影響は、特に人工知能における世界的な競争の文脈で、関心の対象であり続けている。