DeepSeek-R1 2025년 1월

영어에서 번역됨

DeepSeek-R1은 2025년 1월 20일 중국 AI 기업 딥시크(DeepSeek)가 공개한 오픈 가중치 대규모 언어 모델로, 전 세계 기술주 매도세와 엔비디아(Nvidia) 주가 급락을 촉발했다.

DeepSeek-R1은 저장성 항저우에 본사를 둔 중국 AI 기업인 항저우 딥시크 인공지능 기초기술연구소 유한회사가 개발한 오픈 가중치 대규모 언어 모델이다. 2025년 1월 20일에 출시된 이 모델은 서구의 유사 모델 대비 훈련 비용의 일부만으로 고급 추론 능력을 입증하며 상당한 시장 반응을 촉발했다. 며칠 내에 엔비디아의 주가는 급락했고, 투자자들이 인공지능의 경쟁 구도와 고가의 그래픽 처리 장치(GPU) 수요를 재평가하면서 전 세계 기술주는 매도세를 겪었다.

DeepSeek-R1의 출시는 기술적 성과뿐만 아니라 전략적 함의로도 주목할 만했다. 이 모델은 오픈 가중치 라이선스로 제공되어 연구자와 개발자가 매개변수에 접근할 수 있었지만, 훈련 데이터는 공개되지 않았다. 이러한 개방성은 미국 주요 AI 연구소의 독점적 접근 방식과 대조를 이루었으며, 미국의 첨단 칩 수출 통제에도 불구하고 중국 AI 기업의 빠른 발전을 강조했다. 이 사건은 알고리즘 혁신을 통한 효율성 향상과 AI 공급망 변화에 대한 시장의 민감성을 부각시키며 글로벌 AI 경쟁의 이정표가 되었다.

배경

DeepSeek는 2023년 7월 중국 헤지펀드인 High-Flyer의 공동 창업자이자 AI 애호가인 량원펑에 의해 설립되었다. 이 회사는 금융 거래를 위한 딥러닝에 대한 High-Flyer의 초기 연구에서 출발했다. 2023년까지 High-Flyer는 엔비디아 GPU 클러스터를 포함한 상당한 컴퓨팅 인프라를 구축했으며, 이는 DeepSeek의 모델 개발의 기반이 되었다. DeepSeek의 사명은 즉각적인 상업화보다는 연구에 중점을 둔 대규모 언어 모델의 발전에 초점을 맞췄다. 이 회사는 중국 최고 대학의 연구자들과, 이례적으로 시와 고급 수학 같은 비전산과학 분야의 인재들을 채용하여 모델의 지식과 능력을 확장하고자 했다.

DeepSeek의 모델은 오픈 가중치 방식으로, 훈련된 매개변수는 공개되지만 훈련 데이터는 공개 라이선스로 제공되지 않는다. 2025년 1월 이후 DeepSeek는 모델을 자유 및 오픈 소스 소프트웨어 라이선스로 출시했다. 이러한 접근 방식은 마이크로소프트 애저와 퍼플렉시티 AI 같은 클라우드 제공업체가 DeepSeek 모델을 기본적으로 호스팅하는 등 제3자의 채택을 용이하게 했다. 이 회사의 전략은 또한 소비자 대상 기술을 겨냥한 특정 중국 AI 규제를 우회할 수 있게 했는데, 연구와 공개 배포에 초점을 맞춤으로써 직접적인 소비자 노출을 줄였기 때문이다.

개발 및 훈련

DeepSeek의 훈련 인프라는 High-Flyer의 초기 컴퓨팅 클러스터에서 발전했다. 첫 번째 클러스터인 Fire-Flyer는 2019년에 200 Gbit/s로 상호 연결된 1,100개의 GPU로 구축되었으며 비용은 2억 위안이었다. 이 클러스터는 1.5년 후 폐기되었다. 두 번째 클러스터인 Fire-Flyer 2는 2021년에 10억 위안의 예산으로 건설을 시작했으며 625개 노드에 5,000개의 PCIe A100 GPU로 구성되었다. 2022년까지 용량 활용률은 96%를 초과하여 총 5,674만 GPU 시간을 기록했으며, 용량의 27%는 외부 과학 컴퓨팅을 지원했다. 이 클러스터는 효율적인 비동기 무작위 읽기를 위한 Fire-Flyer 파일 시스템(3FS)과 비동기 통신을 위한 hfreduce 라이브러리를 포함한 공동 설계된 소프트웨어 및 하드웨어 아키텍처를 사용했다.

DeepSeek-R1은 추론 작업에 중점을 두고 지도 미세 조정과 강화 학습의 조합으로 훈련되었다. 이 모델은 Transformer (architecture) 아키텍처를 사용했으며 다중 헤드 어텐션잔차 네트워크와 같은 기술을 통합했다. 훈련 과정은 이전 하드웨어와 알고리즘 개선을 활용하여 에너지 소비와 비용을 줄이는 계산 효율성을 강조했다. 이러한 효율성은 최신 고가 칩에 접근하지 않고도 고성능 AI 모델을 개발할 수 있음을 입증했기 때문에 모델의 시장 영향력의 핵심 요인이었다.

출시 및 기술적 특징

DeepSeek-R1은 2025년 1월 20일에 동명의 챗봇과 함께 출시되었다. 이 모델은 추론, 수학, 코딩 벤치마크에서 강력한 성능을 보여주며 미국 연구소의 일부 독점 모델에 필적하거나 능가했다. 오픈 가중치 특성 덕분에 연구자들이 모델을 검사하고 미세 조정할 수 있어 개발자 커뮤니티를 조성했다. 출시에는 여러 버전이 포함되었으며, 플래그십 모델과 더 광범위한 배포를 위해 설계된 더 작은 증류 변형이 있었다.

DeepSeek-R1의 주목할 만한 측면 중 하나는 추론 체인을 개선하기 위해 AI 피드백 기반 강화 학습(RLAIF)을 통합한 훈련 방법론이었다. 이 모델은 단계별 솔루션을 생성하도록 설계되어 복잡한 작업에서 해석 가능성과 정확성을 향상시켰다. 또한 DeepSeek는 출력 다양성을 제어하기 위해 top-p 샘플링온도 스케일링과 같은 기술을 사용했다. 모델의 효율성은 성능 저하 없이 계산 부담을 줄인 모델 가지치기데이터 증강의 혁신에 부분적으로 기인했다.

시장 영향

DeepSeek-R1 출시 이후 글로벌 금융 시장은 상당한 반응을 경험했다. 2025년 1월 27일 엔비디아의 주가는 약 17% 하락하여 수천억 달러의 시장 가치가 증발했다. 매도세는 AMD, 브로드컴, TSMC를 포함한 다른 기술 기업으로 확산되었는데, 투자자들은 AI 모델이 더 효율적으로 훈련될 수 있다면 고급 GPU 수요가 줄어들 수 있다고 우려했기 때문이다. 마이크로소프트알파벳을 포함한 더 넓은 기술 부문도 경쟁 압력과 AI 인프라 지출 감소 가능성에 대한 우려를 반영하여 하락세를 보였다.

시장 반응은 여러 요인에 의해 주도되었다. DeepSeek-R1의 성능은 대규모 GPU 클러스터가 고급 AI의 전제 조건이라는 가정을 약화시키며, 더 적은 컴퓨팅 자원으로 최첨단 AI 능력을 달성할 수 있음을 시사했다. 또한 모델의 오픈 가중치 제공은 미국 AI 기업의 독점적 이점을 위협하여 AI 기술을 상품화할 가능성이 있었다. 분석가들은 매도세가 미국의 수출 통제에도 불구하고 중국 기업이 기술적 동등성을 입증한 지정학적 함의에 대한 반응이기도 하다고 지적했다.

업계 반응

업계 지도자와 전문가들은 DeepSeek-R1에 대해 다양한 반응을 보였다. 일부는 모델의 효율성과 개방적 접근 방식을 칭찬하며 AI의 민주화 세력으로 보았다. 다른 이들은 모델의 오픈 가중치를 고려하여 국가 안보와 오용 가능성에 대한 우려를 표명했다. 2026년 2월, Anthropic은 DeepSeek가 자체 LLM을 훈련하기 위해 수천 개의 사기 계정을 사용하여 자사 AI 모델인 Claude와 수백만 건의 대화를 생성했다고 비난했다. 이 주장은 미국과 중국 AI 기업 간의 경쟁적 긴장을 부각시켰다.

DeepSeek의 성공은 또한 미국 수출 통제의 효과에 대한 논의를 촉발했다. 이 회사는 제한이 강화되기 전에 10,000개의 엔비디아 A100 GPU를 확보한 것으로 알려졌으며, 지속적인 발전은 알고리즘 혁신이 하드웨어 제한을 부분적으로 상쇄할 수 있음을 시사했다. 일부 관찰자들은 국내 AI 연구에 대한 투자 증가를 촉구했고, 다른 이들은 더 세밀한 수출 정책을 주장했다.

더 넓은 맥락

DeepSeek-R1의 출시는 빠르게 진화하는 AI 환경 속에서 이루어졌다. OpenAI, Anthropic, Google DeepMind 같은 주요 기업들은 점점 더 강력한 모델을 개발하고 있었지만, 그 독점적 특성은 외부 검증을 제한했다. DeepSeek의 오픈 가중치 접근 방식은 독립적인 검증과 적응을 가능하게 하는 대안을 제공했다. 이 모델은 또한 덜 강력한 하드웨어에서도 배포가 가능한 효율성과 개방적 라이선스 덕분에 개발도상국 지역의 AI 접근성에 함의를 가졌다.

DeepSeek의 아프리카 확장은 저렴하고 에너지 효율적인 AI 솔루션을 제공하며 이러한 더 넓은 추세의 일부였다. 이 회사는 화웨이 같은 현지 스타트업 및 클라우드 제공업체와 협력하여 아프리카 언어 모델을 강화하고 현지 데이터 주권을 지원했다. 이는 종종 상당한 인프라를 요구하고 데이터 프라이버시 우려를 제기하는 서구 AI 플랫폼과 대조를 이루었다.

여파

출시 이후 몇 달 동안 DeepSeek는 기술 개발과 입지 확장을 계속했다. 이 회사는 2026년 5월 시리즈 A 자금 조달 라운드에서 520억 달러의 후행 가치 평가로 70억 달러를 모금할 계획을 발표했다. 2026년 7월에는 2027년 이른 시기에 기업공개(IPO) 가능성에 대한 보도가 나왔으며, 700억 달러의 선행 가치 평가를 목표로 한 논의가 진행 중이었다. 이러한 발전은 이전의 시장 혼란에도 불구하고 DeepSeek의 궤적에 대한 투자자 신뢰를 시사했다.

엔비디아 주가 하락과 기술주 매도세는 AI 돌파구가 금융 시장을 어떻게 혼란시킬 수 있는지 보여주는 사례 연구가 되었다. 이는 기술 발전과 산업 역학을 재편할 잠재력을 모니터링하는 것의 중요성을 강조했다. DeepSeek에게 이 사건은 글로벌 AI 경쟁에서 주요 플레이어로서의 평판을 공고히 했으며, 미국 기술 거대 기업의 지배력에 도전하고 전 세계 AI 투자 전략의 재평가를 촉발했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·large-language-model·technology-event·market-impact
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사