DeepSeek-R1は、中国のAI企業である杭州DeepSeek人工知能基礎技術研究有限公司(浙江省杭州市に拠点を置く)が開発したオープンウェイトの大規模言語モデルである。2025年1月20日にリリースされたこのモデルは、同等の西洋モデルと比較してわずかな訓練コストで高度な推論能力を示し、大きな市場反応を引き起こした。数日以内にNvidiaの株価は急落し、投資家が人工知能の競争環境と高価なグラフィックス処理ユニット(GPU)への需要を再評価するにつれて、世界中のテクノロジー株が売り浴びせられた。
DeepSeek-R1のリリースは、その技術的成果だけでなく、戦略的含意においても注目に値するものであった。このモデルはオープンウェイトライセンスの下で利用可能となり、研究者や開発者がそのパラメータにアクセスできるようにしたが、訓練データは公開されなかった。この開放性は、米国の主要AI研究所の独自アプローチとは対照的であり、米国の先端チップ輸出規制にもかかわらず中国のAI企業が急速に進歩していることを浮き彫りにした。この出来事は、世界的なAI競争におけるマイルストーンとなり、アルゴリズム革新による効率向上の可能性と、AIサプライチェーンの変化に対する市場の敏感さの両方を強調した。
背景
DeepSeekは、2023年7月にAI愛好家であり中国のヘッジファンドであるHigh-Flyerの共同創設者である梁文鋒によって設立された。同社は、金融取引のための深層学習に関するHigh-Flyerの初期の研究から生まれた。2023年までに、High-FlyerはNvidia GPUのクラスターを含む substantial なコンピューティングインフラを構築しており、これがDeepSeekのモデル開発の基盤となった。DeepSeekの使命は、即時の商業化よりも研究に重点を置いた大規模言語モデルの進歩に焦点を当てていた。同社は、中国のトップ大学から研究者を採用し、異例なことに、詩や高度な数学などのコンピュータサイエンス以外の分野からも研究者を採用し、モデルの知識と能力を広げることを目指した。
DeepSeekのモデルはオープンウェイトであり、訓練されたパラメータは公開されているが、訓練データはオープンライセンスではない。2025年1月以降、DeepSeekはモデルを無料のオープンソースソフトウェアライセンスの下でリリースしている。このアプローチは、Microsoft AzureやPerplexity AIなどのクラウドプロバイダーを含む第三者による採用を促進し、彼らはDeepSeekモデルをネイティブにホストしている。同社の戦略はまた、消費者向け技術を対象とした特定の中国のAI規制を回避することも可能にした。なぜなら、研究とオープンな配布に焦点を当てることで、直接的な消費者露出が減少したからである。
開発と訓練
DeepSeekの訓練インフラは、High-Flyerの初期のコンピューティングクラスターから進化した。最初のクラスターであるFire-Flyerは、2019年に200 Gbit/sで相互接続された1,100基のGPUで構築され、2億元のコストがかかった。これは1.5年後に廃止された。2番目のクラスターであるFire-Flyer 2は、2021年に10億元の予算で建設が開始され、625ノードで5,000基のPCIe A100 GPUで構成された。2022年までに、その容量利用率は96%を超え、合計5,674万GPU時間に達し、容量の27%が外部の科学計算をサポートした。このクラスターは、効率的な非同期ランダム読み取りのためのFire-Flyerファイルシステム(3FS)や、非同期通信のためのhfreduceライブラリなど、共同設計されたソフトウェアとハードウェアのアーキテクチャを使用した。
DeepSeek-R1は、教師あり微調整と強化学習の組み合わせを使用して訓練され、推論タスクに焦点を当てた。このモデルはTransformer (architecture)アーキテクチャを採用し、マルチヘッドアテンションや残差ネットワークなどの技術を組み込んだ。訓練プロセスは計算効率を強調し、古いハードウェアとアルゴリズムの改良を活用してエネルギー消費とコストを削減した。この効率性は、モデルの市場影響における重要な要因であり、最新の最も高価なチップにアクセスしなくても高性能なAIモデルを開発できることを示した。
リリースと技術的特徴
DeepSeek-R1は、2025年1月20日に同名のチャットボットとともにリリースされた。このモデルは、推論、数学、コーディングのベンチマークで強いパフォーマンスを示し、米国の研究所の一部の独自モデルに匹敵またはそれを上回った。そのオープンウェイトの性質により、研究者はモデルを検査し微調整することができ、開発者のコミュニティを育成した。リリースには複数のバージョンが含まれ、フラッグシップモデルと、より広範な展開用に設計された小さな蒸留バリアントがあった。
DeepSeek-R1の注目すべき側面の1つは、その訓練方法論であり、推論チェーンを改善するためにAIフィードバックからの強化学習(RLAIF)を組み込んだ。このモデルは、ステップバイステップのソリューションを生成するように設計され、複雑なタスクでの解釈可能性と正確性を向上させた。さらに、DeepSeekは出力の多様性を制御するためにトップpサンプリングや温度スケーリングなどの技術を採用した。モデルの効率性は、モデルプルーニングやデータ拡張の革新に一部起因しており、パフォーマンスを犠牲にすることなく計算負荷を削減した。
市場への影響
DeepSeek-R1のリリース後、世界の金融市場は大きな反応を示した。2025年1月27日、Nvidiaの株価は約17%下落し、数千億ドルの市場価値が消失した。売り浴びせは、AMD、Broadcom、TSMCなどの他のテクノロジー企業にも拡大し、投資家はAIモデルがより効率的に訓練できるならば高級GPUへの需要が減少する可能性を懸念した。Microsoft (AI)やAlphabet Inc.を含む広範なテクノロジーセクターも下落し、競争圧力とAIインフラ支出の減少の可能性への懸念を反映した。
市場反応はいくつかの要因によって引き起こされた。DeepSeek-R1のパフォーマンスは、最先端のAI能力がより少ない計算リソースで達成できることを示唆し、大規模なGPUクラスターが高度なAIの前提条件であるという仮定を損なった。さらに、モデルのオープンウェイトの利用可能性は、米国のAI企業の独自の利点を脅かし、AI技術をコモディティ化する可能性があった。アナリストは、売り浴びせが地政学的含意への反応でもあると指摘した。中国の企業が米国の輸出規制にもかかわらず技術的同等性を示したからである。
業界の反応
業界リーダーや専門家は、DeepSeek-R1に対してさまざまな反応を示した。一部はモデルの効率性とオープンなアプローチを賞賛し、AIの民主化勢力と見なした。他の人々は、モデルのオープンウェイトを考慮して、国家安全保障と悪用の可能性への懸念を表明した。2026年2月、AnthropicはDeepSeekが数千の不正アカウントを使用して、自社のAIモデルであるClaudeとの数百万の会話を生成し、DeepSeekのLLMを訓練したと非難した。この申し立ては、米国と中国のAI企業間の競争的緊張を浮き彫りにした。
DeepSeekの成功はまた、米国の輸出規制の有効性についての議論を促した。同社は規制が強化される前に10,000基のNvidia A100 GPUを取得したと報告されており、その継続的な進歩は、アルゴリズム革新がハードウェアの制限を部分的に相殺できることを示唆した。一部の観察者は国内のAI研究への投資増加を求め、他の人々はより微妙な輸出政策を提唱した。
より広い文脈
DeepSeek-R1のリリースは、急速に進化するAI環境の中で発生した。OpenAI、Anthropic、Google DeepMindなどの主要プレーヤーは、ますます強力なモデルを開発していたが、その独自の性質は外部の精査を制限した。DeepSeekのオープンウェイトアプローチは、独立した検証と適応を可能にする代替手段を提供した。このモデルはまた、発展途上地域でのAIアクセシビリティにも影響を与えた。なぜなら、その効率性とオープンライセンスにより、より強力でないハードウェアでの展開が可能になったからである。
DeepSeekのアフリカへの拡大は、手頃でエネルギー効率の高いAIソリューションを提供するものであり、この広範なトレンドの一部であった。同社は地元のスタートアップやHuaweiなどのクラウドプロバイダーと協力して、アフリカの言語モデルを強化し、地元のデータ主権をサポートした。これは、しばしば substantial なインフラを必要とし、データプライバシーの懸念を引き起こす西洋のAIプラットフォームとは対照的であった。
余波
リリース後の数ヶ月間、DeepSeekは技術の開発と存在感の拡大を続けた。同社は2026年5月にシリーズA資金調達ラウンドの計画を発表し、ポストマネー評価額520億米ドルで70億米ドルを調達した。2026年7月には、2027年にも上場の可能性があるとの報告が浮上し、プレマネー評価額700億米ドルを目標とした議論が行われた。これらの動きは、初期の市場混乱にもかかわらず、DeepSeekの軌道に対する投資家の信頼を示した。
Nvidiaの株価下落とテクノロジー株の売り浴びせは、AIのブレークスルーが金融市場を混乱させる方法のケーススタディとなった。これは、技術の進歩とその業界ダイナミクスを再形成する可能性を監視することの重要性を強調した。DeepSeekにとって、この出来事は、世界的なAI競争における主要プレーヤーとしての評判を固め、米国のテック大手の支配に挑戦し、世界中のAI投資戦略の再評価を促した。