DeepSeek-R1은 2025년 1월 20일 중국 AI 기업 DeepSeek이 출시한 추론 모델이다. 이 모델은 답변 전에 확장된 Chain-of-thought 추론을 생성하도록 훈련되었으며, 기본 언어 모델에 대규모 Reinforcement learning을 직접 적용하여 수학, 코딩, 논리 벤치마크에서 OpenAI의 o1과 경쟁력 있는 성능을 보고했다. DeepSeek은 R1의 모델 가중치를 MIT 라이선스 하에 공개하고 상세한 기술 논문을 함께 공개했는데, 이는 대부분의 서양 연구소의 유사한 추론 모델이 폐쇄적이고 API 전용이던 시점에 이루어졌다.
훈련 접근법
DeepSeek은 초기 변형인 DeepSeek-R1-Zero를 지도 미세 조정 단계 없이 기본 모델에 대규모 강화 학습을 직접 적용하여 훈련했다고 설명했다. 이 접근법은 강력한 추론을 생성했지만 언어를 혼합하거나 명확한 구조가 부족한 경우가 있어 읽기 어려운 출력을 만들었다. 출시된 DeepSeek-R1 모델은 강화 학습 전에 소량의 "콜드 스타트" 지도 데이터를 추가하고 이후 추가 RL 단계를 거쳐 이 문제를 해결했으며, 대부분의 능력 향상을 유지하면서 더 일관된 추론 과정을 생성했다. DeepSeek은 또한 15억에서 700억 파라미터에 이르는 일련의 더 작은 "증류" 모델을 출시했는데, 이는 Qwen 및 Llama와 같은 기존 오픈 모델을 R1이 생성한 추론 과정으로 미세 조정하여 만들어졌으며, 강력한 추론 스타일 동작을 훨씬 더 작고 배포 가능한 규모에서 제공한다.
비용 주장과 시장 반응
DeepSeek은 기본 V3 모델의 최종 훈련 실행에 GPU 컴퓨팅 비용으로 약 560만 달러가 소요되었다고 밝혔는데, 이는 OpenAI, Anthropic, Google DeepMind가 유사한 최첨단 모델을 훈련하는 데 보고된 수억에서 수십억 달러보다 극적으로 낮은 수치이다. 이 주장은 R1의 벤치마크 성능과 DeepSeek 앱 및 API를 통한 무료 공개 접근성과 결합되어 DeepSeek market shock으로 알려진 사건을 촉발했다. 2025년 1월 27일, NVIDIA의 주식은 단일 거래일 동안 약 17% 하락하여 약 6000억 달러의 시장 가치가 증발했으며, 이는 미국 기업 역사상 최대 단일 일일 손실로, 투자자들이 최첨단 AI에 필요한 컴퓨팅 양에 대한 가정을 재평가하면서 발생했다. 다른 AI 관련 주식도 함께 하락했다. 이후 분석가들은 DeepSeek이 보고한 비용 수치가 이전 연구 비용과 하드웨어 감가상각을 완전히 반영했는지, 그리고 미국 수출 통제에도 불구하고 회사가 제한된 Nvidia 칩에 접근했는지에 대해 논쟁했지만 완전히 해결하지는 못했다.
수용과 영향
DeepSeek-R1은 독립 연구자들에 의해 널리 테스트되었으며 많은 작업에서 주장된 벤치마크에 근접한 성능을 보였지만, DeepSeek 자체 호스팅 앱을 통해 접근할 때 천안문 광장 및 대만과 같은 정치적으로 민감한 주제에 대해 중국 정부에 부합하는 검열을 적용하는 것으로도 발견되었다. 이 제한은 독립적으로 실행될 때 공개된 가중치에는 적용되지 않았다. 이 모델의 출시는 컴퓨팅 중심의 스케일링 패러다임의 지속 가능성과 Artificial intelligence 분야의 미중 경쟁에 대한 논쟁을 강화했으며, 미국 관리들은 이를 AI 칩 수출 통제를 강화해야 하는 증거로 인용한 반면, 다른 이들은 이를 통제가 능력 억제보다 효율성 혁신을 주도하고 있다는 증거로 인용했다. R1은 2025년 가장 중요한 오픈 가중치 모델 출시 중 하나로 자주 언급된다.