DeepSeek-R1は、中国の人工知能企業であるDeepSeekが開発したオープンウェイトの大規模言語モデルである。DeepSeekは浙江省杭州市に拠点を置く。2025年1月に同社の同名チャットボットとともに公開されたDeepSeek-R1は、高度な推論能力と、低コストでの開発が欧米のAI企業の優位性に関する前提に挑戦したことで、世界の金融市場を揺るがし、国際的な注目を集めた。このモデルは、DeepSeekが自由かつオープンソースのソフトウェアライセンスのもとでオープンウェイトモデルを公開するという広範な戦戦略の一部であり、パラメータを公開する一方、学習データは非公開に保っている。
DeepSeekは2023年7月に梁文鋒によって設立され。彼はヘッジファンドのHigh-Flyerの共同創業者でもあり、同社がDeepSeekを所有・資金調達している。2025年1月のDeepSeek-R1の公開は、同社の歴史における重要な節目となり、世界のAI情勢における主要なプレイヤーとしての地位を確立した。このモデルの性能は、効率的な学習手法と相まって、AI開発の未来、特にオープンソースモデルの役割と、米国のチップ輸出制限が中国のAI革新に与える影響についての議論を引き起こした。
背景
DeepSeekの起源は、梁文鋒が2015年6月に共同創業した中国のヘッジファンド、High-Flyerに遡る。梁文鋒は、浙江大学在学中の2008年の金融危機以来取引に携わっており、2016年10月21日には、それまでのCPUベースの線形モデルに代わり、GPUに依存した深層学習モデルを株式取引に使い始めた。2017年末までに、High-Flyerの取引の大部分はAIによって駆動されるようになった。
2019年、High-Flyerは最初のコンピューティングクラスターであるFire-Flyerを2億元の費用で構築した。このクラスターには、200Gbit/sで相互接続された1,100基のGPUが含まれており、1.5年の運用後に廃止された。2021年までに、梁文鋒はAIプロジェクトのために大量のNvidia GPUを購入し始めており、米国が中国へのチップ販売を制限する前に、1万基のNvidia A100 GPUを入手したと報じられている。
Fire-Flyer 2の建設は2021年に始まり、予算は10億元であった。2022年には、Fire-Flyer 2の容量は96%以上使用され、合計5,674万GPU時間に達し、その容量の27%は社外の科学計算を支援していた。このクラスターは、625ノードに5,000基のPCIe A100 GPUを搭載し、各ノードには8基のGPUが含まれており、後にNVLinkとNvidia Collective Communications Library(NCCL)を組み込んで、モデル並列処理を必要とする大規模モデルを学習させた。
設立と初期の発展
2023年4月14日、High-Flyerは汎用人工知能(AGI)研究ラボの開設を発表し、新ラボは同社の金融事業とは無関係のAIツールの開発に焦点を当てると述べた。2か月後の2023年7月17日、そのラボはDeepSeekという独立した会社に分社化され、High-Flyerが主要投資家および支援者となった。当初、ベンチャーキャピタル投資家は、この事業が迅速に出口を生み出す可能性は低いと考え、資金提供に消極的だった。
DeepSeekは浙江省杭州市に本社を置き、High-Flyerが所有・資金調達している。共同創業者の梁文鋒がCEOを務める。2024年5月時点で、梁文鋒は2つのペーパーカンパニーを通じてDeepSeekの84%の株式を個人的に保有していた。同社の戦略は即時の商業化よりも研究を重視しており、消費者向け技術を対象とした中国のAI規制の一部条項を回避することを可能にしている。
DeepSeek-R1の公開
DeepSeek-R1は2025年1月に、同社の同名チャットボットの立ち上げとともに公開された。このモデルの公開は、OpenAIやAnthropicなどの主要な欧米モデルに匹敵する性能を示しながら、その学習コストがわずかであると報じられたため、大きなメディアの報道と市場の反応を生み出した。この公開は、人工知能における中国の成長する能力を示すものと見なされ、高度なAI開発には膨大な計算リソースが必要であるという前提への挑戦と受け止められた。
このモデルのオープンウェイトの性質は、そのパラメータが公開され、世界中の研究者や開発者がダウンロードして微調整できることを意味した。これは、モデルの重みを非公開に保つ多くの欧米のAI企業の独自のアプローチとは対照的であった。DeepSeek-R1の公開はまた、同社が米国のチップ輸出制限下で革新を起こす能力を浮き彫りにし、古いハードウェアを使用して計算効率を最大化するようにアルゴリズムを改良していたことを示した。
技術的および運用面
DeepSeek-R1は、ほとんどの現代の大規模言語モデルの基盤であるトランスフォーマーアーキテクチャに基づいている。このモデルの学習は、共同設計されたソフトウェアとハードウェアのアーキテクチャで構成されるFire-Flyer 2コンピューティングクラスターを活用した。ハードウェア側は、200Gbpsの相互接続を備えたNvidia GPUを使用し、クロスゾーンタスクをサポートする2つのゾーンに分割されている。ネットワークトポロジは、高い二分帯域幅のために選択された2つのファットツリーで構成されている。
ソフトウェア側には、Direct I/OとRDMA Readを使用した非同期ランダム読み取り用に設計された分散並列ファイルシステムである3FS(Fire-Flyer File System)が含まれる。標準のBuffered I/Oとは異なり、Direct I/Oはデータをキャッシュしない。これは、読み取られる各データがランダムで再利用されないため有益である。このクラスターはまた、特定の操作においてNvidia Collective Communications Library(NCCL)を置き換えるために設計された非同期通信ライブラリであるhfreduceも使用している。
DeepSeekの学習アプローチは効率性を重視しており、ハードウェアの制約にもかかわらず競争力のある性能を達成することを可能にしている。同社は研究に焦点を当てており、商業化の当面の計画はないと述べており、市場の圧力よりも技術革新を優先することを可能にしている。
市場への影響と評価
2025年1月のDeepSeek-R1の公開は、世界の金融市場、特にテクノロジー株に大きな影響を与えた。このモデルの性能は、低い学習コストの報告と相まって、NvidiaなどのAIインフラのリーダーと見なされる企業の株売りを引き起こした。この出来事は、AIの競争環境が変化しており、中国のオープンソースモデルが米国拠点のAI企業の優位性を混乱させる可能性があるという兆候として広く解釈された。
DeepSeek-R1は、その推論能力が称賛され、特定のベンチマークでは主要な独自モデルに匹敵するか、それを上回った。このモデルのオープンウェイトの性質はまた、Microsoft AzureやPerplexity AIなどのクラウドプロバイダーによる採用を促進し、それらはネイティブにホストした。この広範な利用可能性は、研究者や開発者の間での人気に貢献した。
しかし、この公開は、オープンウェイトモデルがAIの安全性と規制に与える影響についての懸念も引き起こした。一部の専門家は、強力な推論モデルの広範な利用可能性がリスクをもたらす可能性があると主張し、他の専門家はAI技術の民主化を歓迎した。この出来事は、特に米中間の地政学的緊張を踏まえ、AIガバナンスに関する国際協力の必要性についての議論を引き起こした。
より広い文脈と今後の方向性
DeepSeek-R1の公開は、米国の輸出規制にもかかわらず競争力のあるモデルを開発している中国のAI企業の広範な傾向の一部である。DeepSeekは、古いハードウェアを活用し、エネルギー消費を削減しながら、計算効率を最大化するためにアルゴリズムを継続的に改良してきた。同社はまた、アフリカに拡大し、より手頃で電力消費の少ないAIソリューションを提供し、アフリカの言語モデルを強化して、例えばナイロビなどで多くのスタートアップを生み出している。Huaweiのストレージおよびクラウドコンピューティングサービスとともに、サハラ以南アフリカのテックシーンへの影響は大きく、DeepSeekは欧米のAIプラットフォームと比較して、現地のデータ主権とより柔軟性を提供している。
同社の採用アプローチは、長い実務経験よりもスキルを重視しており、その結果、大学を卒業したばかりの人材が多く採用されている。DeepSeekはまた、コンピュータサイエンスのバックグラウンドを持たない人材を採用して、例えば詩や高度な数学など、モデルに組み込まれる専門知識の範囲を広げている。ニューヨーク・タイムズ紙によると、DeepSeekの研究者の数十人が、中国人民解放軍の研究所および国防七校との関連を持っているか、過去に持っていた。2025年以降、そのチャットボットは、病院、中国人民武装警察部隊の準軍事組織、国家動員組織など、人民解放軍の非戦闘役割で採用された。
2025年初頭時点で、DeepSeek-R1はAIコミュニティにおける重要な参照点であり続けており、オープンソース開発の可能性と生成AIにおける世界的な競争の激化を示している。このモデルの公開は、他の企業に戦略の再考を促し、一部はモデル配布におけるよりオープンなアプローチを模索している。DeepSeek-R1がAI業界に与える長期的な影響はまだ明らかになっていないが、市場と公共の議論への即時の影響は profound であった。