DeepSeek-R1は、中国のAI企業である杭州DeepSeek人工智能基礎技術研究有限公司(浙江省杭州市に拠点を置き、ヘッジファンドのHigh-Flyerが出資)によって開発された、オープンウェイトの大規模言語モデルである。2025年1月にDeepSeekチャットボットとともに公開され、このモデルは主要なプロプライエタリシステムに匹敵する高度な推論能力を示した一方、報告されたトレーニング効率とオープンな利用可能性は、世界的なテクノロジー株の大幅な売りを引き起こし、特にNvidiaや他のチップメーカーに影響を与えた。
この公開はArtificial intelligence分野における注目すべき出来事となり、最先端の大規模言語モデルに膨大な計算リソースが必要であるという前提に疑問を投げかけた。DeepSeek-R1のオープンウェイトの枠組みにより、世界中の研究者や開発者がモデルをダウンロードして適応させることが可能となり、急速な採用と市場の反応に貢献した。
背景と会社の起源
DeepSeekは2023年7月に梁文鋒(Liang Wenfeng)によって設立された。彼は以前、2015年6月にHigh-Flyerを共同設立していた。High-Flyerは2016年10月21日に、それまでのCPUベースの線形モデルから移行し、GPU依存の深層学習モデルを株式取引に使い始めた。2017年末までに、その取引決定の大部分はAIによって駆動されていた。
2019年、High-Flyerは最初のコンピューティングクラスターであるFire-Flyerを2億元の費用で構築し、200 Gbit/sで相互接続された1,100基のGPUを備えていた。このクラスターは1.5年後に廃止された。2021年までに、梁は米国の中国向けチップ販売制限が発効する前に、約10,000基のNvidia A100 GPUを取得していた。
2021年から10億元の予算で構築されたFire-Flyer 2クラスターは、625ノードに5,000基のPCIe A100 GPUを備えて運用を開始した。2022年には、その容量利用率は96%を超え、合計5,674万GPU時間に達し、容量の27%が外部の科学計算を支援した。このクラスターは当初、モデルが単一の40 GB GPU VRAMに収まり、データ並列処理のみが必要だったため、PCIe接続のみを使用していた。その後、モデル並列処理を必要とするより大きなモデルのために、NVLinkとNCCLが追加された。
設立と企業構造
2023年4月14日、High-Flyerは汎用人工知能(AGI)研究ラボの創設を発表した。2か月後の2023年7月17日、そのラボはDeepSeekという独立した会社としてスピンオフされ、High-Flyerが主要投資家となった。ベンチャーキャピタル投資家は当初、迅速な出口を生み出す能力に疑問を抱き、この事業への出資に消極的だった。
DeepSeekは浙江省杭州市に本社を置き、現在もHigh-Flyerが所有・出資している。梁文鋒はCEOを務め、2024年5月時点で、2つのペーパーカンパニーを通じて個人的に84%の株式を保有していた。同社は研究重視の戦略を維持し、即時の商業化計画はないと述べており、これにより消費者向け技術を対象とした中国の特定のAI規制を回避することも可能にしている。
DeepSeek-R1モデル
DeepSeek-R1は2025年1月にオープンウェイトの推論モデルとして公開された。OpenAIやAnthropicなどの企業によるプロプライエタリモデルとは異なり、DeepSeek-R1の正確なパラメータは公開されたが、トレーニングデータはオープンライセンスではなかった。このモデルは推論ベンチマークで強いパフォーマンスを示し、特定のタスクでは主要な西側モデルに匹敵するか、それを上回ると報告された。
このモデルの開発は、米国のチップ輸出制限を考慮した必要性から、計算効率を最大化するためのDeepSeekのアルゴリズムの継続的な改良によって支えられた。この効率性への焦点により、DeepSeekは古いまたは性能の低いハードウェアを使用して競争力のある結果を達成し、エネルギー消費とトレーニングコストを削減することができた。
世界的な市場への影響
DeepSeek-R1の公開後、世界的なテクノロジー株は急激な売りに見舞われた。投資家は、主要なAI企業の高い資本支出が高度なAI能力を達成するために必ずしも必要ではない可能性に反応した。AIトレーニング用GPUの主要サプライヤーであるNvidiaは、その市場価値が大幅に下落し、他のチップメーカーやクラウドプロバイダーも影響を受けた。
この売りは、DeepSeek-R1のようなオープンウェイトモデルがAI開発をコモディティ化し、プロプライエタリなモデルとインフラに多額の投資を行ってきた企業の競争上の堀を縮小させる可能性があるという懸念を反映していた。この出来事は金融メディアで広く取り上げられ、AI投資ブームの持続可能性に関する議論を引き起こした。
採用とエコシステム
オープンウェイトの枠組みにより、DeepSeek-R1および他のDeepSeekモデルは、Microsoft AzureやPerplexity AIを含むクラウドプロバイダーによってネイティブにホストされた。主要プラットフォームでのモデルの利用可能性は、さまざまなアプリケーションや研究プロジェクトへの統合を促進した。
DeepSeekはまた、アフリカにも拡大し、より手頃で電力消費の少ないAIソリューションを提供した。同社はアフリカの言語モデルを強化し、例えばナイロビなどで多数のスタートアップを生み出した。Huaweiのストレージおよびクラウドコンピューティングサービスとともに、DeepSeekのサハラ以南アフリカのテックシーンへの影響は大きく、西側のAIプラットフォームと比較して、現地のデータ主権とより柔軟性を提供している。
トレーニングインフラ
DeepSeekのトレーニングフレームワークはFire-Flyerクラスターに依存しており、Fire-Flyer 2は2025年時点でも運用中である。このクラスターは、ソフトウェアとハードウェアのアーキテクチャを共同設計している。ハードウェア側では、Nvidia GPUが200 Gbpsの相互接続を使用し、ネットワークトポロジは高バイセクションバンド幅のために2つのファットツリーで構成されている。クラスターは2つのゾーンに分割され、クロスゾーンタスクをサポートしている。
ソフトウェア側では、主要なコンポーネントは次のとおりである:
- 3FS(Fire-Flyerファイルシステム):非同期ランダム読み取り用に設計された分散並列ファイルシステムで、Direct I/OとRDMA Readを使用する。標準のBuffered I/Oとは異なり、Direct I/Oはデータをキャッシュしないため、データが再利用されないランダム読み取りに効率的である。
- hfreduce:非同期通信用のライブラリで、特定のシナリオでNvidiaのNCCLを置き換えるために設計され、スケーラビリティとパフォーマンスを向上させた。
これらの革新により、DeepSeekはハードウェアの制約にもかかわらず大規模モデルを効率的にトレーニングでき、DeepSeek-R1が示したコスト効率に貢献した。
その後の展開
2026年2月、AnthropicはDeepSeekが数千の不正アカウントを使用してClaudeとの数百万の会話を生成し、自社モデルのトレーニングに使用したと非難した。2026年4月、投資家はDeepSeekを100億ドルと評価する3億ドルの資金調達ラウンドについて協議を開始した。同社は2026年5月にシリーズAラウンドを完了し、70億米ドルを受け取り、ポストマネー評価額は520億米ドルに達した。
2026年7月、ブルームバーグとフィナンシャル・タイムズは、DeepSeekが新規株式公開(IPO)の準備を開始し、早ければ2027年にも上場する可能性があると報じた。同月、同社は700億米ドルのプレマネー評価額を目標とする別の資金調達協議を開始した。
DeepSeekの採用アプローチは、長い実務経験よりもスキルを重視しており、その結果、大学を卒業したばかりの採用者が多い。同社はまた、詩や高度な数学などの分野での専門知識を拡大するために、コンピュータサイエンスのバックグラウンドを持たない個人も採用している。ニューヨーク・タイムズによると、数十人のDeepSeek研究者が中国人民解放軍の研究所や国防七子との提携を持っている、または持っていたことがある。2025年以降、そのチャットボットは病院、中国人民武装警察部隊、国防動員組織など、人民解放軍の非戦闘役割で採用された。
結論
2025年1月のDeepSeek-R1の公開は、Generative AIの状況における重要なマイルストーンを表し、オープンウェイトモデルがより少ないリソース要件で競争力のあるパフォーマンスを達成できることを実証した。世界的なテック株の売りは、このモデルの破壊的潜在力を浮き彫りにし、その後の資金調達ラウンドとIPO準備は強い投資家の関心を示した。DeepSeekの効率性とオープンな利用可能性への継続的な焦点は、進化するAIエコシステムにおける注目すべきプレーヤーとしての地位を確立している。