2025年1月、杭州に拠点を置く中国の人工知能企業であるDeepSeekは、オープンウェイトの推論モデルであるDeepSeek-R1をリリースした。このリリースは、世界的な株式市場の大幅な売りを引き起こし、特にテクノロジー株に影響を与え、AI業界の競争環境と投資前提の広範な再評価を促した。この出来事は、中国のAI研究所の急速な進歩と、より効率的で低コストなモデル開発の可能性を浮き彫りにした。
DeepSeekは、2023年7月に梁文鋒によって設立され、中国のヘッジファンドであるHigh-Flyerが所有・資金提供している。同社は、オープンウェイトの大規模言語モデル(LLM)の開発に注力しており、モデルのパラメータを公開する一方で、トレーニングデータは非公開にしている。DeepSeek-R1は、同名のチャットボットとともに発表され、西側の主要モデルに匹敵する高度な推論能力を示したが、報告されたトレーニングコストはその一部に過ぎなかった。この成果は、最先端のAIには膨大な計算リソースと巨額の資本支出が必要であるという従来の考え方に挑戦するものだった。
市場への影響
2025年1月27日、DeepSeek-R1のリリースにより、世界のテクノロジー株は急落した。主要なGPUメーカーであるNvidiaの株価は約17%下落し、約5890億ドルの時価総額が消失した。これは、米国株式市場の歴史において、単一企業として最大の1日の損失となった。AMD、Broadcom、TSMCなどの他のチップメーカーやAI関連企業も、大幅な下落を経験した。売りは欧州やアジアの市場にも波及し、日経225やテクノロジー株中心のナスダック総合指数などの指標も顕著に下落した。
市場の反応は、DeepSeekの効率的なトレーニング手法が、高価なAIハードウェア、特に高性能GPUへの需要を減少させる可能性があるという投資家の懸念によって引き起こされた。DeepSeekは、R1のトレーニングに約2048基のNvidia H800 GPUを2ヶ月間使用し、コストは約560万ドルだったと報告されている。これは、OpenAIやGoogle DeepMindなどの西側の研究所が費やす数億ドルと比較して、ごく一部である。このことは、主要なクラウドプロバイダーやAI企業による巨額の資本支出の持続可能性に疑問を投げかけた。
業界の再評価
このリリースは、業界全体のAI開発戦略の再評価を促した。Microsoft (AI)やAlphabet Inc.を含む大手テクノロジー企業の幹部は、DeepSeekの成果とAI効率への影響を公に認めた。一部のアナリストは、この出来事がオープンウェイトモデルの採用を加速させ、生の計算能力の拡大ではなく、モデル最適化におけるイノベーションを促進する可能性があると示唆した。
DeepSeekの成功は、推論能力を向上させるためのReinforcement learning(RL)の使用や、トークンごとにパラメータのサブセットのみを活性化して計算負荷を軽減するMixture of experts(MoE)アーキテクチャの実装など、いくつかの技術的革新に起因していた。同社はまた、米国による中国への先端チップ輸出制限の影響もあり、古いハードウェアでの効率を最大化するためにトレーニングアルゴリズムを改良した。
DeepSeekの背景
DeepSeekは、2023年7月17日に独立企業として設立され、2023年4月14日に発表されたHigh-Flyerの人工知能(AGI)研究所からスピンオフした。High-Flyerは、2015年6月に梁文鋒によって共同設立され、2016年10月21日から株式取引にGPUベースの深層学習を使用していた。同社は2019年に最初のコンピューティングクラスターであるFire-Flyerを構築し、その後、2021年に完成した5,000基のNvidia A100 GPUを備えたより大規模なクラスターであるFire-Flyer 2を構築した。
DeepSeekの採用戦略は、経験よりもスキルを重視し、多くの新卒者やコンピューターサイエンス以外の分野からの人材を採用して、モデルの知識を広げている。同社は研究に注力しており、当面の商業化計画はないと述べており、これにより中国の特定の規制免除の下で運営することが可能になっている。
技術的革新
DeepSeek-R1は、多段階のトレーニングパイプラインを使用する推論モデルである。Reinforcement learningを使用して思考連鎖の推論を改善し、厳選されたデータを用いた教師ありファインチューニング(SFT)を使用している。モデルのアーキテクチャには、Multi-Head AttentionとMixture of experts層が組み込まれており、効率的なスケーリングを可能にしている。DeepSeekはまた、検証可能な回答を持つタスクに対してルールベースの報酬を使用することで、別個の報酬モデルを必要としない新しいRLアプローチを導入した。
Fire-Flyer 2として知られるトレーニングインフラストラクチャは、共同設計されたソフトウェアとハードウェアのアーキテクチャで構成されている。200 Gbpsの相互接続を備えたNvidia GPUと、高バイセクション帯域幅のための2つのファットツリーのネットワークトポロジを使用している。ソフトウェアスタックには、非同期ランダム読み取り用に最適化された分散並列ファイルシステムである3FS(Fire-Flyer File System)と、非同期通信用のライブラリであるhfreduceが含まれている。
競争環境
DeepSeek-R1のリリースは、特に米国と中国の企業間で、AI業界の競争を激化させた。これは、ハードウェアの制限にもかかわらず、中国の研究所が最先端の結果を達成できることを示した。DeepSeekのオープンウェイトアプローチは、OpenAIやAnthropicのクローズドモデルとは対照的であり、その透明性とカスタマイズ性から、一部の西側開発者に受け入れられている。
microsoft-azureやPerplexity AIを含む主要なクラウドプロバイダーは、DeepSeekモデルをネイティブにホストし始め、それらを世界のAIエコシステムにさらに統合した。この出来事はまた、AIの安全性と輸出規制に関する議論を引き起こし、一部の政策立案者はオープンウェイトモデルに対するより厳しい規制を求めた。
長期的な影響
市場の衝撃は、投資家やテクノロジー企業にとっての目覚ましとなり、予期しないソースからの破壊的イノベーションの可能性を浮き彫りにした。これは、アルゴリズム効率の重要性と、より少ないリソースで高性能を達成する可能性を強調した。2025年初頭の時点で、AIハードウェア需要と業界構造への長期的な影響は不確実なままであったが、この出来事は世界のAI競争における転換点を示した。
DeepSeekの台頭はまた、地政学的な問題も提起した。同社の研究者は中国の軍事研究所と関係があり、そのチャットボットは2025年3月以降、中国人民解放軍によって非戦闘役割で採用されている。これらの動向は、国際的なAI情勢に複雑さの層を加えた。
結論
DeepSeek-R1のリリースとその後の市場の衝撃は、人工知能の歴史における極めて重要な瞬間を示した。これは、オープンウェイトモデルがプロプライエタリなシステムに匹敵し得ることを実証し、大規模な計算の必要性に関する前提に挑戦し、投資家の期待を再形成した。この出来事は、AI効率、オープンソースの協力、そしてAIパワーの世界的なバランスに関する議論を加速させ、その影響は2025年を通じて展開し続けた。