DeepSeek-R1은 2025년 1월에 출시된 중국 인공지능 기업 딥시크(DeepSeek)가 개발한 대규모 언어 모델이다. 이 모델은 미국 기업들의 주요 독점 모델과 견줄 만한 고급 추론 능력과 오픈소스 제공으로 국제적 주목을 받았다. 출시는 글로벌 주식 시장, 특히 기술 및 반도체 주식에 상당한 변동성을 촉발했으며, 미국과 중국 간 인공지능 경쟁 구도에 대한 논의를 강화했다.
이 모델은 오픈소스 라이선스로 제공되어 전 세계 연구자와 개발자가 아키텍처에 접근하고 수정하며 구축할 수 있게 했다. 이러한 결정은 일반적으로 가장 강력한 모델을 독점 응용 프로그래밍 인터페이스를 통해 제공한 여러 주요 서양 AI 연구소의 제한적 출시 전략과 대조되었다. DeepSeek-R1의 벤치마크 테스트 성능과 보고된 낮은 훈련 비용은 최첨단 AI 역량을 달성하는 데 필요한 자원에 대한 기존 가정에 도전했다.
배경 및 개발
DeepSeek은 2023년 중국 기업가이자 퀀트 금융 전문가인 량원펑(Liang Wenfeng)에 의해 설립되었다. 이 회사는 헤지펀드 하이플라이어(High-Flyer)의 연구 중심 자회사로 운영되었으며, 상당한 컴퓨팅 자원을 제공받았다. 2024년 말, DeepSeek은 이전 모델인 DeepSeek-V3를 출시했으며, 이 모델은 이미 다양한 자연어 처리 작업에서 경쟁력 있는 성능을 보여주었다.
DeepSeek-R1의 개발은 Deep learning 및 Neural network 아키텍처의 발전을 기반으로 했다. 이 모델은 대부분의 현대 Large language model이 사용하는 기본 설계인 Transformer (architecture) 아키텍처를 채택했다. DeepSeek의 연구팀은 강화 학습과 사고 사슬 프롬프팅과 같은 기법을 통해 추론 능력을 향상시키는 데 중점을 두었으며, 이는 모델이 복잡한 문제를 중간 단계로 분해할 수 있게 한다.
회사의 기술 보고서에 따르면, DeepSeek-R1은 지도 미세 조정과 강화 학습의 조합을 사용하여 훈련되었다. 훈련 과정은 명시적 추론 흔적의 개발을 강조하여 모델이 출력에 대한 상세한 논리적 설명을 생성할 수 있게 했다. 이러한 접근 방식은 유사한 방법을 이전 모델에서 탐구한 OpenAI 및 Google DeepMind를 포함한 기관의 연구에서 영감을 받았다.
기술 사양
DeepSeek-R1은 혼합 전문가 아키텍처로 구축되었으며, 이는 각 입력에 대해 모델 매개변수의 하위 집합만 활성화하여 계산 효율성을 향상시키는 설계이다. 전체 모델은 약 6710억 개의 총 매개변수를 포함했으며, 추론 중에는 370억 개의 활성 매개변수가 있었다. 이 아키텍처는 각 쿼리의 계산 비용을 줄이면서 높은 성능을 달성할 수 있게 했다.
이 모델은 128,000 토큰의 컨텍스트 창을 지원하여 긴 문서를 처리하고 확장된 대화에서 일관성을 유지할 수 있었다. 중국어와 영어 데이터에 중점을 둔 다양한 텍스트 및 코드 말뭉치로 훈련되었다. DeepSeek은 또한 15억에서 700억 매개변수 범위의 증류 버전 모델을 출시했으며, 이는 소비자 하드웨어 및 엣지 디바이스 배포를 위해 설계되었다.
DeepSeek-R1은 훈련 방법론에 여러 혁신을 통합했다. 연구팀은 훈련 안정성을 개선한 강화 학습 변형인 그룹 상대 정책 최적화라는 기법을 사용했다. 또한 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습)을 활용하여 모델의 응답을 정제하고 광범위한 인간 주석의 필요성을 줄였다.
출시 및 오픈소스 배포
DeepSeek-R1의 공식 출시는 2025년 1월 20일에 이루어졌다. 모델 가중치는 Hugging Face 플랫폼을 통해 공개되었으며, 코드는 오픈소스 라이선스로 GitHub에 게시되었다. 이러한 배포 모델은 독립 연구자들이 모델의 결과를 재현하고 자체 평가를 수행할 수 있게 했다.
DeepSeek-R1의 오픈소스 특성은 출시의 정의적 특징이었다. OpenAI의 GPT-4나 Anthropic의 Claude와 같은 모델이 유료 API를 통해서만 접근 가능했던 것과 달리, DeepSeek-R1은 로컬에서 다운로드하고 실행할 수 있었다. 이러한 접근성은 특히 예산이 제한된 학술 기관과 스타트업의 AI 연구 개발 진입 장벽을 낮췄다.
DeepSeek은 또한 모델의 아키텍처, 훈련 절차 및 평가 결과에 대한 상세한 문서를 제공했다. 회사는 연구 방법론을 설명하는 기술 논문을 게시했으며, 이는 AI 연구 커뮤니티에서 널리 논의되었다. 제3자 조직이 수행한 독립 벤치마크는 회사의 모델 능력 주장을 대체로 확인했다.
성능 및 벤치마크
DeepSeek-R1은 추론 및 문제 해결을 위한 여러 주요 벤치마크에서 최첨단 결과를 달성했다. 수학적 문제 해결 능력을 테스트하는 MATH 데이터 세트에서 모델은 97.3%를 기록하여 OpenAI 및 Anthropic이 개발한 모델의 이전 최고 결과를 능가했다. 코드 생성 벤치마크인 HumanEval에서 DeepSeek-R1은 pass@1 점수 92.4%를 달성하여 대다수 프로그래밍 작업에서 첫 시도에 올바른 솔루션을 생성했음을 나타냈다.
이 모델은 일반 지식 및 언어 이해 벤치마크에서도 강력한 성능을 보였다. 과학, 인문학 및 사회 과학을 포함한 57개 과목을 다루는 MMLU(대규모 다중 작업 언어 이해) 벤치마크에서 DeepSeek-R1은 90.8%를 기록했다. 이는 당시 사용 가능한 가장 고급 시스템과 비교할 수 있는 대규모 언어 모델의 최상위 계층에 위치했다.
Stanford AI Lab 및 BAIR (Berkeley AI Research)와 같은 기관의 연구자들이 수행한 독립 평가는 모델의 강력한 성능을 확인했다. 이러한 평가는 DeepSeek-R1이 확장된 추론 체인에서 논리적 일관성을 유지할 수 있는 다단계 추론 작업에서 특히 인상적인 능력을 보여주었다고 언급했다. 답변에 대한 상세한 설명을 제공하는 모델의 능력도 차별화된 특징으로 강조되었다.
글로벌 AI 경쟁에 미치는 영향
DeepSeek-R1의 출시는 인공지능의 글로벌 경쟁 구도에 중요한 의미를 가졌다. 이 모델은 중국 AI 기업이 미국 기업과 비교할 수 있는 결과를 달성할 수 있음을 보여주었으며, 미국이 AI 개발에서 결정적 우위를 점하고 있다는 인식에 도전했다. 이러한 발전은 양국 정책 입안자와 업계 지도자들이 면밀히 주시했다.
DeepSeek-R1의 오픈소스 배포는 또한 더 넓은 AI 생태계에 영향을 미쳤다. 많은 개발자와 기업이 특히 독점 모델에 대한 접근이 제한되거나 비용이 많이 드는 지역에서 자체 응용 프로그램의 기반으로 이 모델을 채택했다. 고성능 오픈소스 모델의 가용성은 이전에 AI 서비스 시장을 지배했던 기업들의 시장 지배력을 줄였다.
DeepSeek의 보고된 훈련 비용은 미국 기업의 유사한 모델보다 현저히 낮았다. 회사는 DeepSeek-R1이 약 560만 달러에 훈련되었다고 주장했으며, 이는 GPT-4와 같은 모델의 추정 비용(1억 달러 이상으로 추정)의 일부에 불과했다. 이러한 비용 효율성은 혼합 전문가 아키텍처와 최적화된 훈련 절차에 기인했으며, OpenAI 및 Google DeepMind와 같은 기업이 수행한 대규모 투자가 최첨단 AI 역량을 달성하는 데 필요한지에 대한 의문을 제기했다.
주식 시장 반응
DeepSeek-R1의 출시는 글로벌 금융 시장에서 즉각적이고 상당한 반응을 촉발했다. 출시 후 첫 거래일인 2025년 1월 27일, 기술 주식은 상당한 하락을 경험했다. AI 그래픽 처리 장치의 선도 제조업체인 엔비디아는 주가가 약 17% 하락하여 하루 만에 약 6000억 달러의 시장 가치가 증발했다. 이는 회사 역사상 가장 큰 단일 일일 시가총액 손실이었다.
다른 반도체 기업들도 급격한 하락을 경험했다. AMD, Intel 및 TSMC 모두 주가가 두 자릿수 비율로 하락했다. 매도세는 DeepSeek-R1과 관련된 낮은 훈련 비용이 고급 AI 칩에 대한 미래 수요를 줄일 수 있다는 투자자 우려에 의해 주도되었다. 일부 분석가는 모델의 효율성이 데이터 센터 인프라 지출 성장의 둔화로 이어질 수 있다고 추측했다.
반대로 일부 기업은 시장 반응에서 이익을 얻었다. Amazon Web Services, Microsoft Azure 및 Google Cloud와 같은 오픈소스 모델에 대한 접근을 제공하는 클라우드 서비스 제공업체는 투자자들이 AI 추론 서비스에 대한 수요 증가를 예상하면서 주가가 상승했다. 시장의 상반된 반응은 AI 효율성의 발전의 복잡한 경제적 의미를 강조했다.
업계 대응 및 반응
출시 후 몇 주 동안 주요 AI 기업의 경영진과 연구자들은 DeepSeek-R1에 대해 공개적으로 언급했다. OpenAI의 CEO인 샘 알트만은 모델의 인상적인 성능을 인정하고 자신의 회사가 연구 노력을 가속화할 것이라고 밝혔다. Google DeepMind의 CEO인 데미스 하사비스는 DeepSeek-R1을 AI에서 공개 연구의 중요성을 입증한 중요한 성과로 설명했다.
출시는 또한 수출 통제 및 기술 정책에 대한 논의를 촉발했다. 일부 미국 정책 입안자들은 중국에 대한 AI 칩 수출에 대한 더 엄격한 제한을 요구했으며, DeepSeek의 성공이 기술 우위를 유지할 필요성을 보여준다고 주장했다. 다른 이들은 모델의 오픈소스 특성이 지식과 기술이 국경을 넘어 자유롭게 공유될 수 있기 때문에 그러한 통제를 덜 효과적으로 만든다고 제안했다.
여러 기업이 DeepSeek-R1을 제품과 서비스에 통합할 계획을 발표했다. Alibaba Cloud 및 기타 중국 클라우드 제공업체는 플랫폼을 통해 모델을 제공했으며, 국제 기업은 배포를 위한 파트너십을 모색했다. 모델의 가용성은 또한 개발자들이 더 넓은 범위의 하드웨어에 배포하려고 함에 따라 모델 압축 및 효율적인 추론과 같은 분야의 연구를 자극했다.
AI 개발에 대한 광범위한 의미
DeepSeek-R1의 출시는 인공지능 분야에 지속적인 영향을 미쳤다. 이는 오픈소스 모델이 가장 까다로운 벤치마크에서 독점 시스템과 경쟁할 수 있음을 보여주었으며, 최고의 AI가 반드시 폐쇄된 환경에서 개발될 것이라는 가정에 도전했다. 이러한 발전은 다른 연구 그룹이 모델 개발에 더 투명한 접근 방식을 추구하도록 장려했다.
이 모델은 또한 특히 추론 분야에서 AI 연구의 방향에 영향을 미쳤다. DeepSeek의 훈련 방법론의 성공은 다른 연구소가 강화 학습 및 자기 대결의 더 정교한 사용을 포함한 유사한 기법을 탐구하도록 촉구했다. 명시적 추론 흔적에 대한 강조는 이후 다양한 기업의 모델 출시에서 일반적인 특징이 되었다.
더 넓은 기술 산업의 경우, DeepSeek-R1은 AI 개발에서 알고리즘 효율성의 중요성을 강조했다. 모델의 상대적으로 낮은 훈련 비용은 업계의 컴퓨팅 자원 확장에 대한 초점이 훈련 기법의 혁신으로 보완될 수 있음을 시사했다. 이러한 관점은 부문 전반에 걸쳐 투자 결정과 연구 우선순위에 영향을 미쳤다.
DeepSeek-R1의 지정학적 의미는 2025년 내내 계속 논의되었다. 이 모델은 중국의 인공지능 성장 능력의 상징으로 작용했으며, 오픈소스 배포는 기술 이전 제한의 효과에 대한 의문을 제기했다. 출시는 글로벌 AI 경쟁의 전환점으로 널리 간주되었으며, 경쟁 균형이 이동하기 시작한 순간을 표시했다.