DeepSeek-R1は、中国のAI企業DeepSeekが2025年1月20日に公開した推論モデルである。このモデルは、回答前に拡張された思考連鎖推論を生成するよう訓練されており、大規模な強化学習を基盤となる言語モデルに直接適用することで、数学、コーディング、論理のベンチマークにおいてOpenAIのo1と競合する性能を報告した。DeepSeekは、R1のモデル重みをMITライセンスのもとで公開し、詳細な技術論文も併せて公開したが、これは西洋の主要研究所による同等の推論モデルの多くが非公開でAPI限定だった時期に行われた。
訓練アプローチ
DeepSeekは、初期バリアントであるDeepSeek-R1-Zeroを、教師あり学習段階を一切行わずに、基盤モデルへ直接大規模な強化学習を適用して訓練したと説明している。このアプローチは強力な推論を生み出したが、出力が読みにくく、言語が混在したり明確な構造が欠けたりすることがあった。公開されたDeepSeek-R1モデルは、強化学習の前に少量の「コールドスタート」教師ありデータを追加し、その後にさらなる強化学習段階を経ることで、能力の向上を維持しつつ、より一貫性のある推論トレースを生成するように改善された。また、DeepSeekは、R1によって生成された推論トレースを用いてQwenやLlamaなどの既存のオープンモデルを微調整して作成した、15億から700億パラメータの範囲の小型「蒸留」モデル群も公開し、強力な推論スタイルの動作をはるかに小型で展開しやすい規模で利用可能にした。
コスト主張と市場反応
DeepSeekは、基盤となるV3モデルの最終訓練実行にかかったGPU計算コストが約560万ドルであると述べており、これはOpenAI、Anthropic、Google DeepMindによる同等のフロンティアモデルの訓練に費やされたと報告されている数億から数十億ドルと比較して劇的に低い数字である。この主張は、R1のベンチマーク性能と、DeepSeekのアプリやAPIを通じた無料の一般公開と相まって、いわゆるDeepSeekショックを引き起こした。2025年1月27日、NVIDIAの株価は1日の取引で約17%下落し、約6000億ドルの時価総額が消失した。これは米国企業として当時最大の1日あたりの損失であり、投資家がフロンティアAIに必要な計算量についての前提を再評価したためである。他のAI関連株も同時に下落した。その後、アナリストは、DeepSeekが報告したコスト数字が以前の研究コストやハードウェアの償却を完全に考慮しているかどうか、また同社が米国の輸出規制にもかかわらず制限されたNVIDIAチップにアクセスしていたかどうかについて議論したが、完全に解決するには至らなかった。
受容と影響
DeepSeek-R1は独立した研究者によって広くテストされ、多くのタスクで主張されたベンチマークに近い性能を示すことが確認されたが、DeepSeek自身がホストするアプリを通じてアクセスした場合、天安門広場や台湾などの政治的に敏感なトピックについて中国政府に沿った検閲が適用されることも判明した。この制限は、独立して実行された場合の公開された重みには適用されない。このモデルの公開は、計算駆動型のスケーリング則パラダイムの持続可能性と、人工知能における米中競争に関する議論を激化させ、米国当局はAIチップの輸出規制を強化する証拠として引用する一方、他の人々は規制が能力の封じ込めではなく効率革新を促進している証拠として引用した。R1は、2025年で最も重要なオープンウェイトモデルの公開の1つとして頻繁に引用されている。